MiniCPM-V

★★★★★ 4.4 分

面壁智能的端侧多模态模型,8B 小尺寸实现强视觉能力,可部署到手机与边缘设备。

视觉轻量开源端侧
参数量MiniCPM-V 2.6(8B)
模型类型端侧多模态视觉语言模型
许可证MiniCPM 社区许可
开发者面壁智能(ModelBest)
★★★★★ 4.6

8B 端侧多模态,超越 GPT-4V 的性价比之选

多模态开源视觉端侧OCR

模型介绍

MiniCPM-V 是面壁智能(ModelBest/OpenBMB)的端侧多模态视觉语言模型系列,主打「小模型 + 强视觉」。MiniCPM-V 2.6 以 SigLip-400M 视觉编码器 + Qwen2-7B 组成 8B 总参,官方宣称在单图、多图与视频理解上全面超越 GPT-4V,并领先 GPT-4o mini、Gemini 1.5 Pro、Claude 3.5 Sonnet。凭借高 token 密度与强 OCR 能力,int4 量化后约 7GB 显存即可本地运行,是低显存用户接入顶级视觉能力的一条捷径。

模型基本信息

开发机构面壁智能(ModelBest / OpenBMB)
模型版本MiniCPM-V 2.6
参数规模8B(SigLip-400M 视觉 + Qwen2-7B)
模型类型端侧多模态视觉语言模型
许可证MiniCPM 模型许可(代码 Apache-2.0,商用需登记)
上下文长度32K
发布日期2024-08-06
模型架构SigLip-400M 视觉编码器 + MLP 投影 + Qwen2-7B LLM

模型能力

中文能力很强
英文能力强
代码能力强
推理能力强
长文本能力中
视觉能力很强
工具调用弱

模型版本

MiniCPM-V 2.68BMiniCPM-V 2.6 int48B(int4,约7GB)MiniCPM-V 2.6 GGUF8B(GGUF,约6GB)MiniCPM-Llama3-V 2.58B(Llama3 基座)

模型获取

部署方式

transformersvLLMllama.cppOllamaLM Studio

显存需求

2.6 FP16约17GB
2.6 int4约7GB
2.6 GGUF Q4约6GB

硬件推荐

RTX 3060int4/GGUF 约7GB 可跑
RTX 3090int4/FP16 均可流畅
RTX 4090FP16 全显存推理舒适
RTX 5090余量充足,可上多图高分辨率
Mac16GB 内存可跑 GGUF 端侧版

推荐配置

入门RTX 3060 12G + 2.6 int4(约7GB)
进阶RTX 3090 24G + 2.6 FP16(约17GB)
专业RTX 4090/5090 + 2.6 原生多图/视频帧推理

为什么选择这个模型

  • 8B 端侧尺寸即可对标 GPT-4V,性价比极高
  • int4 仅约 7GB 显存,12GB 卡即可本地部署
  • Ollama/llama.cpp 官方支持,端侧与桌面部署链路成熟
  • OCR 与中文多模态能力突出
  • 多图/视频流理解能力同级独有

模型优点

  • 官方基准大幅超越 GPT-4V/GPT-4o mini
  • int4 + GGUF 双量化路线,显存门槛低
  • 支持多图对比与视频实时理解
  • Ollama 一键拉取即可使用
  • 中文场景 OCR 与问答体验好

模型缺点

  • 模型许可商用需填写问卷登记
  • 长上下文(>8K)支持一般
  • 复杂数学图表推理弱于 InternVL 大版本
  • 基座为 Qwen2 架构,更新迭代依赖官方跟进

适合场景

  • 低显存(12GB)本地视觉部署
  • 端侧/移动端与边缘设备多模态
  • 文档 OCR 与截图理解
  • 多图对比、视频抽帧问答
  • 中文多模态教学与演示

不适合场景

  • 需要 32K+ 长图文上下文的任务
  • 极致数学推理/图表解析(选 InternVL2.5-38B 及以上)
  • 严格合规场景(许可证登记要求)
  • 大规模并发生产(7B 单卡吞吐有限)

部署教程

Ollama
brew install ollama && ollama run minicpm-v:8b(首次拉取 8B 权重)
LM Studio
LM Studio 搜索 minicpm-v2.6 的 GGUF 或直接用 openbmb 官方 gguf 仓库加载
llama.cpp
从 HF 下载 MiniCPM-V-2_6-gguf,命令:./llama-cli -m minicpm-v2.6-q4_k_m.gguf --image 图片 -p 提示词 -ngl 999
vLLM
pip install vllm && vllm serve openbmb/MiniCPM-V-2_6 --limit-mm-per-prompt image=4

智算工坊实验室

实测速度8B int4 ≈25-30 token/s(RTX 4090 实测参考)
显存占用FP16 约17GB;int4 约7GB;GGUF 约6GB
功耗整机约300W
不同 GPU 对比3060 跑 int4 可用,3090/4090 可全显存 FP16

常见问题 FAQ

MiniCPM-V 2.6 商用有什么要求?

代码 Apache-2.0,但模型权重遵循 MiniCPM 模型许可:学术研究免费,商用需先在官方问卷登记,审核通过后免费商用。

Ollama 里怎么选版本?

官方库标签 minicpm-v:8b 即 2.6;如需更省的显存可选 int4 或 GGUF 权重自行加载。

相关模型

相关工具

相关硬件

数据来源

  • https://huggingface.co/openbmb/MiniCPM-V-2_6
  • https://github.com/OpenBMB/MiniCPM-V
  • https://modelscope.cn/models/openbmb/MiniCPM-V-2_6