LLaVA

★★★★★ 4.3 分

经典开源视觉助手模型,架构简洁、微调门槛低,搭配 llama.cpp 生态可在消费级显卡本地看图会话。

视觉开源轻量学术
参数量LLaVA 7B / 13B / LLaVA-NeXT
模型类型视觉语言助手(VLM,CLIP 视觉塔 + LLM)
许可证Apache 2.0
开发者Open-VCLab / 微软研究与高校合作
★★★★★ 4.2

开源多模态视觉助手的经典启蒙之作

多模态开源视觉经典微调

模型介绍

LLaVA 由微软研究院与威斯康星大学等提出,是开源视觉语言模型的奠基之作,其「视觉编码器 + MLP 投影 + LLM」的简洁架构被大量后续模型沿用。LLaVA-1.6(LLaVA-NeXT)系列升级为多图视觉编码方案:v1.6-Mistral-7B 基于 Mistral-7B,支持 32K 文本上下文、多图拼接与 1152×1152 分辨率。Apache-2.0 许可与极低的微调门槛,加上 Ollama/llama.cpp 全链路支持,是学习视觉指令微调与低成本本地看图会话的最佳入门。

模型基本信息

开发机构微软研究院 / 威斯康星大学等(HF 由 llava-hf 维护)
模型版本LLaVA-1.6(LLaVA-NeXT)Mistral-7B
参数规模7B(CLIP-ViT-336px + Mistral-7B);另有 13B/34B 档
模型类型多模态视觉对话模型(视觉指令跟随)
许可证Apache-2.0
上下文长度32K(Mistral-7B 文本上限)
发布日期2024-01(LLaVA-1.6 发布);HF 仓库 2024-02-20
模型架构CLIP ViT-L/14-336px 视觉编码器 + MLP 投影 + Vicuna/Mistral LLM

模型能力

中文能力中
英文能力强
代码能力中
推理能力中
长文本能力中
视觉能力强
工具调用弱

模型版本

llava-v1.6-mistral-7b-hf7Bllava-v1.6-vicuna-13b-hf13Bllava-v1.6-34b-hf34Bllava-v1.5-7b-hf7B(经典人气版)

模型获取

部署方式

OllamaLM Studiollama.cppvLLMtransformers

显存需求

7B FP16约16GB
7B Q4约6GB
13B Q4约10GB

硬件推荐

RTX 3060可跑 7B Q4
RTX 30907B 原生/13B Q4
RTX 409013B 原生/34B Q4
RTX 509034B Q4/原生
Mac16GB+ 内存可跑 7B Q4

推荐配置

入门RTX 3060 12G + 7B Q4(约6GB)
进阶RTX 3090/4090 + 13B Q4 或 7B 原生
专业RTX 5090/A100 + 34B 系列

为什么选择这个模型

  • 架构简单、可解释性强,视觉指令微调的最佳样本
  • Apache-2.0 许可,商用无忧
  • Ollama/llama.cpp 原生支持,本地部署最顺滑
  • 论文与代码高度开源,社区资料最丰富

模型优点

  • 生态庞大,几乎所有部署框架都原生支持
  • 7B Q4 约 6GB 显存,入门门槛极低
  • 支持多图拼接与图像-语言对话
  • 微调数据/代码全公开,二次开发资料全
  • 官方 Ollama 标签即拉即用

模型缺点

  • 新版表现被 InternVL2.5/Qwen2.5-VL 拉开差距
  • 中文场景能力一般(英文训练为主)
  • 复杂图表与密集文档理解较弱
  • 34B 档显存门槛高、社区 GGUF 较少

适合场景

  • 学习视觉指令微调与多模态原理
  • 低成本本地看图问答/OCR 入门
  • 低显存设备上的视觉助手原型
  • 学术研究与复现

不适合场景

  • 对 OCR/图表精度要求极高的生产场景
  • 中文多模态产品主力模型
  • 最新视觉 SOTA 竞赛
  • 长视频内容理解

部署教程

Ollama
brew install ollama && ollama run llava-llama3:8b(或 llava:7b/13b)
LM Studio
LM Studio 搜索 llava 的 GGUF 下载,加载后选择 GPU 加速即可
llama.cpp
从 HF 下载 GGUF,命令:./llama-cli -m llava-v1.6-mistral-7b-q4_k_m.gguf --image 图片 -p 提示词 --mmproj mmproj-model-f16.gguf -ngl 999
vLLM
pip install vllm && vllm serve llava-hf/llava-v1.6-mistral-7b-hf

智算工坊实验室

实测速度7B Q4 ≈40 token/s(RTX 4090 实测参考)
显存占用7B FP16 约16GB;Q4 约6GB
功耗整机约300W
不同 GPU 对比3060 跑 7B Q4 流畅,3090/4090 可上 13B/34B

常见问题 FAQ

LLaVA 与 LLaVA-NeXT(1.6)有什么区别?

1.6 升级为更大的语言基座(Mistral/34B)、多图拼接与更高分辨率(1152×1152),文档与多图理解显著提升,成为 LLaVA-NeXT 系列。

为什么现在还要选 LLaVA?

入门学习与微调门槛最低、生态最完善;追求最新性能建议选 InternVL2.5 或 Qwen2.5-VL。

相关模型

相关工具

相关硬件

数据来源

  • https://huggingface.co/llava-hf/llava-v1.6-mistral-7b-hf
  • https://llava-vl.github.io/
  • https://arxiv.org/abs/2310.03744