开源多模态视觉助手的经典启蒙之作
模型介绍
LLaVA 由微软研究院与威斯康星大学等提出,是开源视觉语言模型的奠基之作,其「视觉编码器 + MLP 投影 + LLM」的简洁架构被大量后续模型沿用。LLaVA-1.6(LLaVA-NeXT)系列升级为多图视觉编码方案:v1.6-Mistral-7B 基于 Mistral-7B,支持 32K 文本上下文、多图拼接与 1152×1152 分辨率。Apache-2.0 许可与极低的微调门槛,加上 Ollama/llama.cpp 全链路支持,是学习视觉指令微调与低成本本地看图会话的最佳入门。
模型基本信息
开发机构微软研究院 / 威斯康星大学等(HF 由 llava-hf 维护)
模型版本LLaVA-1.6(LLaVA-NeXT)Mistral-7B
参数规模7B(CLIP-ViT-336px + Mistral-7B);另有 13B/34B 档
模型类型多模态视觉对话模型(视觉指令跟随)
许可证Apache-2.0
上下文长度32K(Mistral-7B 文本上限)
发布日期2024-01(LLaVA-1.6 发布);HF 仓库 2024-02-20
模型架构CLIP ViT-L/14-336px 视觉编码器 + MLP 投影 + Vicuna/Mistral LLM
模型能力
中文能力中
英文能力强
代码能力中
推理能力中
长文本能力中
视觉能力强
工具调用弱
模型版本
llava-v1.6-mistral-7b-hf7Bllava-v1.6-vicuna-13b-hf13Bllava-v1.6-34b-hf34Bllava-v1.5-7b-hf7B(经典人气版)
模型获取
部署方式
OllamaLM Studiollama.cppvLLMtransformers
显存需求
7B FP16约16GB
7B Q4约6GB
13B Q4约10GB
硬件推荐
RTX 3060可跑 7B Q4
RTX 30907B 原生/13B Q4
RTX 409013B 原生/34B Q4
RTX 509034B Q4/原生
Mac16GB+ 内存可跑 7B Q4
推荐配置
入门RTX 3060 12G + 7B Q4(约6GB)
进阶RTX 3090/4090 + 13B Q4 或 7B 原生
专业RTX 5090/A100 + 34B 系列
为什么选择这个模型
- 架构简单、可解释性强,视觉指令微调的最佳样本
- Apache-2.0 许可,商用无忧
- Ollama/llama.cpp 原生支持,本地部署最顺滑
- 论文与代码高度开源,社区资料最丰富
模型优点
- 生态庞大,几乎所有部署框架都原生支持
- 7B Q4 约 6GB 显存,入门门槛极低
- 支持多图拼接与图像-语言对话
- 微调数据/代码全公开,二次开发资料全
- 官方 Ollama 标签即拉即用
模型缺点
- 新版表现被 InternVL2.5/Qwen2.5-VL 拉开差距
- 中文场景能力一般(英文训练为主)
- 复杂图表与密集文档理解较弱
- 34B 档显存门槛高、社区 GGUF 较少
适合场景
- 学习视觉指令微调与多模态原理
- 低成本本地看图问答/OCR 入门
- 低显存设备上的视觉助手原型
- 学术研究与复现
不适合场景
- 对 OCR/图表精度要求极高的生产场景
- 中文多模态产品主力模型
- 最新视觉 SOTA 竞赛
- 长视频内容理解
部署教程
Ollama
brew install ollama && ollama run llava-llama3:8b(或 llava:7b/13b)
LM Studio
LM Studio 搜索 llava 的 GGUF 下载,加载后选择 GPU 加速即可
llama.cpp
从 HF 下载 GGUF,命令:./llama-cli -m llava-v1.6-mistral-7b-q4_k_m.gguf --image 图片 -p 提示词 --mmproj mmproj-model-f16.gguf -ngl 999
vLLM
pip install vllm && vllm serve llava-hf/llava-v1.6-mistral-7b-hf
智算工坊实验室
实测速度7B Q4 ≈40 token/s(RTX 4090 实测参考)
显存占用7B FP16 约16GB;Q4 约6GB
功耗整机约300W
不同 GPU 对比3060 跑 7B Q4 流畅,3090/4090 可上 13B/34B
常见问题 FAQ
LLaVA 与 LLaVA-NeXT(1.6)有什么区别?
1.6 升级为更大的语言基座(Mistral/34B)、多图拼接与更高分辨率(1152×1152),文档与多图理解显著提升,成为 LLaVA-NeXT 系列。
为什么现在还要选 LLaVA?
入门学习与微调门槛最低、生态最完善;追求最新性能建议选 InternVL2.5 或 Qwen2.5-VL。
相关模型
相关工具
相关硬件
数据来源
- https://huggingface.co/llava-hf/llava-v1.6-mistral-7b-hf
- https://llava-vl.github.io/
- https://arxiv.org/abs/2310.03744