InternVL

★★★★★ 4.6 分

上海AI实验室的开源视觉语言模型,OCR 与图表理解能力国际领先,多尺寸可选,本地部署首选之一。

视觉中文开源OCR
参数量InternVL2.5 2B / 8B / 26B / 78B
模型类型多模态视觉语言模型(VLM)
许可证MIT
开发者上海人工智能实验室
★★★★★ 4.7

OCR 与图表理解顶尖的开源多模态家族

多模态开源视觉OCR中文

模型介绍

InternVL(书生·万象)是上海人工智能实验室(OpenGVLab)的多模态视觉语言模型家族,采用「ViT-MLP-LLM」范式,把预训练 InternViT 视觉编码器与 InternLM/Qwen 语言骨干拼接。InternVL2.5 覆盖 1B~78B 七个尺寸,1B 即可跑端侧,8B 是 12GB 显卡甜点,78B 在多模态基准上媲美 GPT-4o 等闭源旗舰。动态分辨率切块、32K 上下文与顶尖 OCR/图表理解,让它成为中文语境下本地部署视觉模型的热门选择。

模型基本信息

开发机构上海人工智能实验室(OpenGVLab)
模型版本InternVL2.5 系列
参数规模1B/2B/4B/8B/26B/38B/78B
模型类型多模态视觉语言模型
许可证MIT
上下文长度32K
发布日期2024-11-20
模型架构InternViT-300M/6B 视觉编码器 + InternLM2.5/Qwen2.5 语言骨干(ViT-MLP-LLM)

模型能力

中文能力很强
英文能力很强
代码能力强
推理能力强
长文本能力强
视觉能力很强
工具调用弱

模型版本

InternVL2.5-8B8.08B(InternViT-300M + InternLM2.5-7B)InternVL2.5-26B25.51B(InternViT-6B + InternLM2.5-20B)InternVL2.5-78B78.41B(InternViT-6B + Qwen2.5-72B)

模型获取

部署方式

transformersvLLMLMDeployLM Studio

显存需求

8B FP16约17GB
8B Q4约8GB
2B Q4约2.5GB

硬件推荐

RTX 3060可跑 1B/2B,2B Q4 约2.5GB
RTX 3090可跑 8B Q4
RTX 4090可跑 8B 原生/26B Q4
RTX 5090可跑 26B Q4/38B Q4
Mac32GB 内存可跑 8B

推荐配置

入门RTX 3060 12G + InternVL2.5-2B Q4
进阶RTX 4090 24G + InternVL2.5-8B(原生或 Q4)
专业A100/H100 + InternVL2.5-26B/78B

为什么选择这个模型

  • OCR、图表与文档理解能力国际领先,8B 就能接近闭源旗舰
  • MIT 许可,商用无限制,生态最宽松
  • 1B~78B 全尺寸覆盖,从手机到集群都有对应版本
  • 中文/英文双语表现均衡,国内社区教程丰富

模型优点

  • MMMU 70+、DocVQA 90+ 的顶级多模态成绩
  • 动态分辨率分块,超长宽图和密集文档细节保留好
  • 多尺寸可选,低显存友好(2B 端侧可跑)
  • vLLM/LMDeploy/transformers 全部官方支持
  • MIT 协议,商用部署零障碍

模型缺点

  • 视频理解能力弱于专用视频模型
  • 工具调用/Agent 能力一般
  • 最大 78B 需多卡才能本地推理
  • 社区量化(GGUF/Ollama)仍需自行转换

适合场景

  • PDF/截图/票据的 OCR 与版面理解
  • 图表、公式、数学题查看与问答
  • 中英双语多模态对话
  • 低显存设备上的视觉助手
  • 企业私有化文档解析

不适合场景

  • 需要视频内容理解的场景
  • 深度工具调用 Agent
  • 单卡 12GB 以下跑 8B 原生权重
  • 追求一键 Ollama 部署的用户

部署教程

Ollama
官方暂未上架库,可从 LMDeploy/transformers 启动,或用社区 GGUF 转 Ollama Modelfile
LM Studio
LM Studio 搜索 InternVL2.5 社区 GGUF,下载后加载并可启用 GPU 加速
llama.cpp
从 HF 下载社区 GGUF 权重,命令:./llama-cli -m internvl2_5-8b-q4_k_m.gguf --image 图片 -p 提示词 -ngl 999
vLLM
pip install vllm && vllm serve OpenGVLab/InternVL2_5-8B --limit-mm-per-prompt image=4

智算工坊实验室

实测速度8B ≈30 token/s(RTX 4090 实测参考)
显存占用约17GB(FP16);Q4 约8GB
功耗整机约300W
不同 GPU 对比RTX 4090 可流畅 8B 推理,3090 用 Q4 亦可;26B 需 5090/多卡

常见问题 FAQ

InternVL2.5 与其他开源多模态怎么选?

看重 OCR/图表/文档解析优先 InternVL2.5;要更强文本对话与工具调用选 Qwen2.5-VL;要端侧轻量选 MiniCPM-V。

8B 需要多大显存?

FP16 约 17GB(24GB 卡舒适),Q4 量化后约 8GB,12GB 显卡也能跑。

相关模型

相关工具

相关硬件

数据来源

  • https://huggingface.co/OpenGVLab/InternVL2_5-8B
  • https://internvl.github.io/blog/2024-12-05-InternVL-2.5/
  • https://internvl.github.io/