Qwen-VL

★★★★★ 4.7 分

阿里的开源视觉语言模型,中文 OCR 与截图理解能力突出,一张 12GB 显卡即可本地部署,替代闭源视觉 API。

视觉中文开源OCR
参数量Qwen2-VL 2B / 7B / Qwen2.5-VL 3B / 7B / 72B
模型类型多模态视觉语言模型(VLM)
许可证Apache 2.0
开发者阿里巴巴 / 通义实验室
★★★★★ 4.7

阿里开源旗舰,中文 OCR 与截图理解最强

多模态开源视觉OCR中文

模型介绍

Qwen-VL 是阿里通义实验室的开源视觉语言模型系列,与 Qwen 文本模型共享生态。Qwen2.5-VL 采用动态分辨率视觉编码器(类 NaViT)、窗口注意力与多模态旋转位置编码(M-RoPE),提供 3B/7B/32B/72B 四档尺寸、32K 上下文,在中英文 MMMU、DocVQA、OCRBench 等榜单刷新纪录,中文 OCR 与截图理解尤其突出,后续已迭代至 Qwen3-VL/Omni。7B 版 Q4 后约 7GB 显存,12GB 显卡即可本地部署,是替代闭源视觉 API 的热门开源之选。

模型基本信息

开发机构阿里巴巴 / 通义实验室
模型版本Qwen2.5-VL 系列(后续已迭代 Qwen3-VL/Omni)
参数规模3B/7B/32B/72B
模型类型多模态视觉语言模型
许可证Apache-2.0
上下文长度32K
发布日期2025-01-26
模型架构Qwen2.5-VL:动态分辨率 ViT(NaViT)+ 窗口注意力 + 多模态旋转位置编码(M-RoPE)

模型能力

中文能力很强
英文能力很强
代码能力强
推理能力强
长文本能力强
视觉能力很强
工具调用弱

模型版本

Qwen2.5-VL-3B-Instruct3B(端侧)Qwen2.5-VL-7B-Instruct7B(单卡首选)Qwen2.5-VL-32B-Instruct32BQwen2.5-VL-72B-Instruct72B(多卡/集群)

模型获取

部署方式

transformersvLLMSGLangOllamaLM Studio

显存需求

7B FP16约17GB
7B Q4约7GB
3B Q4约3.5GB

硬件推荐

RTX 3060可跑 3B Q4 / 7B Q4
RTX 3090可跑 7B FP16 或 32B Q4
RTX 40907B 原生流畅,32B Q4 可用
RTX 509032B/72B Q4 多卡
Mac16GB+ 内存可跑 7B Q4

推荐配置

入门RTX 3060 12G + Qwen2.5-VL-7B Q4(约7GB)
进阶RTX 4090 24G + Qwen2.5-VL-7B 原生 / 32B Q4
专业RTX 5090 ×2 或 A100 + Qwen2.5-VL-72B

为什么选择这个模型

  • 中文 OCR、截图与文档理解开源最强之一
  • Apache-2.0 全责商用,无许可障碍
  • 3B~72B 全覆盖,低显存到集群都有版本
  • Ollama/vLLM/SGLang 官方适配,生态最完整

模型优点

  • MMMU 69.9、OCRBench 高分的中英文多模态成绩
  • 动态分辨率,长图/高分辨率细节保真
  • 官方 Ollama 标签 qwen2.5vl:7b 一键部署
  • 中文社区教程丰富,Qwen 全家桶生态联动
  • 支持坐标/对象定位等精细视觉任务

模型缺点

  • 7B 视觉细节逊于 32B/72B
  • 视频理解弱于专用视频模型
  • 工具调用(视觉+工具)体验一般
  • 32B 以上单卡难以 FP16 部署

适合场景

  • 中文截图/PDF/票据 OCR 与信息抽取
  • 网页截图、表格、图表理解
  • 替代闭源视觉 API 的私有化部署
  • 长图与高分辨率图像问答

不适合场景

  • 需要多轮视频内容理解
  • 严格的 Agent 工具调用多模态任务
  • 单卡跑 32B 原生权重
  • 追求最高推理精度的竞赛级视觉推理(可选闭源)

部署教程

Ollama
brew install ollama && ollama run qwen2.5vl:7b(3b/32b 换标签)
LM Studio
LM Studio 搜索 qwen2.5-vl-7b 的 GGUF 下载并加载,启用 GPU 加速即可
llama.cpp
从 HF 下载 GGUF,命令:./llama-cli -m qwen2.5-vl-7b-instruct-q4_k_m.gguf --image 图片 -p 提示词 -ngl 999
vLLM
pip install vllm && vllm serve Qwen/Qwen2.5-VL-7B-Instruct --limit-mm-per-prompt image=4

智算工坊实验室

实测速度7B Q4 ≈30-40 token/s(RTX 4090 实测参考)
显存占用7B FP16 约17GB;Q4 约7GB
功耗整机约300W
不同 GPU 对比3060 跑 7B Q4 可用,3090/4090 跑 7B 原生或 32B Q4

常见问题 FAQ

Qwen2.5-VL 与 InternVL2.5 怎么选?

中文 OCR/截图与 Qwen 生态选 Qwen2.5-VL;文档/图表深度解析与更低显存端侧选 InternVL2.5 或 MiniCPM-V。

7B 需要多大显存?

FP16 约 17GB(24GB 卡舒适),Q4 量化约 7GB,12GB 显卡即可本地运行。

相关模型

相关工具

相关硬件

数据来源

  • https://huggingface.co/Qwen/Qwen2.5-VL-7B-Instruct
  • https://qwenlm.github.io/blog/qwen2.5-vl/
  • https://modelscope.cn/models/Qwen/Qwen2.5-VL-7B-Instruct