OCR 与图表理解顶尖的开源多模态家族
模型介绍
InternVL(书生·万象)是上海人工智能实验室(OpenGVLab)的多模态视觉语言模型家族,采用「ViT-MLP-LLM」范式,把预训练 InternViT 视觉编码器与 InternLM/Qwen 语言骨干拼接。InternVL2.5 覆盖 1B~78B 七个尺寸,1B 即可跑端侧,8B 是 12GB 显卡甜点,78B 在多模态基准上媲美 GPT-4o 等闭源旗舰。动态分辨率切块、32K 上下文与顶尖 OCR/图表理解,让它成为中文语境下本地部署视觉模型的热门选择。
模型基本信息
开发机构上海人工智能实验室(OpenGVLab)
模型版本InternVL2.5 系列
参数规模1B/2B/4B/8B/26B/38B/78B
模型类型多模态视觉语言模型
许可证MIT
上下文长度32K
发布日期2024-11-20
模型架构InternViT-300M/6B 视觉编码器 + InternLM2.5/Qwen2.5 语言骨干(ViT-MLP-LLM)
模型能力
中文能力很强
英文能力很强
代码能力强
推理能力强
长文本能力强
视觉能力很强
工具调用弱
模型版本
InternVL2.5-8B8.08B(InternViT-300M + InternLM2.5-7B)InternVL2.5-26B25.51B(InternViT-6B + InternLM2.5-20B)InternVL2.5-78B78.41B(InternViT-6B + Qwen2.5-72B)
模型获取
部署方式
transformersvLLMLMDeployLM Studio
显存需求
8B FP16约17GB
8B Q4约8GB
2B Q4约2.5GB
硬件推荐
RTX 3060可跑 1B/2B,2B Q4 约2.5GB
RTX 3090可跑 8B Q4
RTX 4090可跑 8B 原生/26B Q4
RTX 5090可跑 26B Q4/38B Q4
Mac32GB 内存可跑 8B
推荐配置
入门RTX 3060 12G + InternVL2.5-2B Q4
进阶RTX 4090 24G + InternVL2.5-8B(原生或 Q4)
专业A100/H100 + InternVL2.5-26B/78B
为什么选择这个模型
- OCR、图表与文档理解能力国际领先,8B 就能接近闭源旗舰
- MIT 许可,商用无限制,生态最宽松
- 1B~78B 全尺寸覆盖,从手机到集群都有对应版本
- 中文/英文双语表现均衡,国内社区教程丰富
模型优点
- MMMU 70+、DocVQA 90+ 的顶级多模态成绩
- 动态分辨率分块,超长宽图和密集文档细节保留好
- 多尺寸可选,低显存友好(2B 端侧可跑)
- vLLM/LMDeploy/transformers 全部官方支持
- MIT 协议,商用部署零障碍
模型缺点
- 视频理解能力弱于专用视频模型
- 工具调用/Agent 能力一般
- 最大 78B 需多卡才能本地推理
- 社区量化(GGUF/Ollama)仍需自行转换
适合场景
- PDF/截图/票据的 OCR 与版面理解
- 图表、公式、数学题查看与问答
- 中英双语多模态对话
- 低显存设备上的视觉助手
- 企业私有化文档解析
不适合场景
- 需要视频内容理解的场景
- 深度工具调用 Agent
- 单卡 12GB 以下跑 8B 原生权重
- 追求一键 Ollama 部署的用户
部署教程
Ollama
官方暂未上架库,可从 LMDeploy/transformers 启动,或用社区 GGUF 转 Ollama Modelfile
LM Studio
LM Studio 搜索 InternVL2.5 社区 GGUF,下载后加载并可启用 GPU 加速
llama.cpp
从 HF 下载社区 GGUF 权重,命令:./llama-cli -m internvl2_5-8b-q4_k_m.gguf --image 图片 -p 提示词 -ngl 999
vLLM
pip install vllm && vllm serve OpenGVLab/InternVL2_5-8B --limit-mm-per-prompt image=4
智算工坊实验室
实测速度8B ≈30 token/s(RTX 4090 实测参考)
显存占用约17GB(FP16);Q4 约8GB
功耗整机约300W
不同 GPU 对比RTX 4090 可流畅 8B 推理,3090 用 Q4 亦可;26B 需 5090/多卡
常见问题 FAQ
InternVL2.5 与其他开源多模态怎么选?
看重 OCR/图表/文档解析优先 InternVL2.5;要更强文本对话与工具调用选 Qwen2.5-VL;要端侧轻量选 MiniCPM-V。
8B 需要多大显存?
FP16 约 17GB(24GB 卡舒适),Q4 量化后约 8GB,12GB 显卡也能跑。
相关模型
相关工具
相关硬件
NVIDIA GeForce RTX 3060 12GBNVIDIA GeForce RTX 3090NVIDIA GeForce RTX 4090NVIDIA GeForce RTX 5090Apple Mac Studio (M4 Ultra)
数据来源
- https://huggingface.co/OpenGVLab/InternVL2_5-8B
- https://internvl.github.io/blog/2024-12-05-InternVL-2.5/
- https://internvl.github.io/