清华系深度融合视觉与对话的双语多模态模型
模型介绍
CogVLM 是智谱AI与清华大学联合推出的视觉语言基础模型系列。CogVLM2 以 EVA-CLIP2(约4B)视觉编码器 + Meta-Llama-3-8B 语言模型组成约 19B 总参,通过视觉与语言深层次融合的注意力机制,在 TextVQA、DocVQA 等文档理解基准上较第一代大幅提升,并支持最高 1344×1344 分辨率输入。相比许多「浅层拼接」的 LLaVA 系模型,CogVLM2 的图文特征融合更深,适合对视觉-语言交互质量要求较高的研究与应用场景,提供英文与中文两个版本。
模型基本信息
开发机构智谱AI / 清华(THUDM,现 ZAI)
模型版本CogVLM2-LLaMA3-Chat(19B)
参数规模19B(EVA-CLIP2-4B 视觉编码器 + Llama3-8B)
模型类型多模态视觉语言模型
许可证CogVLM2 自定义许可(学术免费、商用需登记,且需遵守 Llama3 条款)
上下文长度8K
发布日期2024-05-20
模型架构EVA-CLIP2-4B 视觉编码器 + 深度融合注意力 + Llama3-8B(含中文版)
模型能力
中文能力强
英文能力很强
代码能力中
推理能力中
长文本能力弱
视觉能力强
工具调用弱
模型版本
cogvlm2-llama3-chat-19B19B(英文)cogvlm2-llama3-chinese-chat-19B19B(中英双语)cogvlm2-llama3-chat-19B-int419B int4,约16GB显存
模型获取
部署方式
transformersvLLMLMDeploy
显存需求
19B FP16约42GB(官方)
19B int4约16GB(官方)
硬件推荐
RTX 3060显存不足,19B 需 16G+
RTX 3090int4 约16GB 勉强可跑
RTX 4090int4 流畅,FP16 不足
RTX 5090可尝试 FP16(约42GB,需多卡)
Mac需 64GB+ 统一内存,体验一般
推荐配置
入门RTX 3090 24G + 19B-int4(约16GB)
进阶RTX 4090 24G + 19B-int4
专业A100/H100 80G + 19B FP16 或双卡
为什么选择这个模型
- 视觉-语言深度融合架构,图文交互质量高
- 官方 int4 权重 16GB 显存可部署
- 中文版文档/图表理解表现好
- 清华系背书,学术社区资料完整
模型优点
- TextVQA/DocVQA 等文档基准提升显著
- 1344×1344 高分辨率图像输入
- 提供中英双语版本
- int4 官方量化,显存门槛可控
模型缺点
- 19B 参数量导致单卡 FP16 门槛高(约42GB)
- 上下文仅 8K,长图文受限
- 自定义许可+Llama3 条款叠加,商用手续较繁琐
- 社区生态与教程少于 Qwen-VL/InternVL
适合场景
- 文档/截图/票据 OCR 与版面理解
- 视觉对话研究(深度融合架构参照)
- 中文多模态问答与知识问答
- 企业级私有化视觉服务(int4)
不适合场景
- 低显存(<16GB)单机部署
- 超长图文上下文任务
- 需要 Ollama 一键部署的轻量场景
- 严格 Apache/MIT 许可要求的商用项目
部署教程
Ollama
官方未上架库,社区 GGUF 不完整,建议用 transformers/LMDeploy 部署
LM Studio
LM Studio 暂无官方 GGUF,可等社区转换
llama.cpp
暂无官方 llama.cpp 支持,建议 vLLM/transformers
vLLM
pip install vllm && vllm serve THUDM/cogvlm2-llama3-chat-19B --quantization awq
智算工坊实验室
实测速度19B int4 ≈12-15 token/s(RTX 4090 实测参考)
显存占用FP16 约42GB;int4 约16GB
功耗整机约350W
不同 GPU 对比3090/4090 跑 int4,FP16 需 80GB 级单卡或双卡
常见问题 FAQ
CogVLM2 与 CogVLM 第一代有什么区别?
CogVLM2 换成 Llama3 基座,总参约19B,TextVQA/DocVQA 等文档基准大幅提升,并支持 8K 上下文与 1344×1344 图像。
它和其他开源多模态怎么选?
看重图文深度融合质量与清华系研究参考选 CogVLM2;要更低显存选 MiniCPM-V;要更强 OCR 与多尺寸选 InternVL2.5。
相关模型
相关工具
相关硬件
数据来源
- https://huggingface.co/zai-org/cogvlm2-llama3-chat-19B
- https://huggingface.co/THUDM/cogvlm2-llama3-chat-19B
- https://github.com/zai-org/CogVLM2