CogVLM

★★★★★ 4.3 分

清华系的开源视觉语言基础模型,视觉能力与对话能力并重,适合高阶视觉应用与研究。

视觉开源智谱基础模型
参数量CogVLM2(19B)/ CogVLM(17B)
模型类型多模态视觉语言基础模型
许可证Apache 2.0
开发者智谱AI / 清华
★★★★★ 4.3

清华系深度融合视觉与对话的双语多模态模型

多模态开源视觉双语

模型介绍

CogVLM 是智谱AI与清华大学联合推出的视觉语言基础模型系列。CogVLM2 以 EVA-CLIP2(约4B)视觉编码器 + Meta-Llama-3-8B 语言模型组成约 19B 总参,通过视觉与语言深层次融合的注意力机制,在 TextVQA、DocVQA 等文档理解基准上较第一代大幅提升,并支持最高 1344×1344 分辨率输入。相比许多「浅层拼接」的 LLaVA 系模型,CogVLM2 的图文特征融合更深,适合对视觉-语言交互质量要求较高的研究与应用场景,提供英文与中文两个版本。

模型基本信息

开发机构智谱AI / 清华(THUDM,现 ZAI)
模型版本CogVLM2-LLaMA3-Chat(19B)
参数规模19B(EVA-CLIP2-4B 视觉编码器 + Llama3-8B)
模型类型多模态视觉语言模型
许可证CogVLM2 自定义许可(学术免费、商用需登记,且需遵守 Llama3 条款)
上下文长度8K
发布日期2024-05-20
模型架构EVA-CLIP2-4B 视觉编码器 + 深度融合注意力 + Llama3-8B(含中文版)

模型能力

中文能力强
英文能力很强
代码能力中
推理能力中
长文本能力弱
视觉能力强
工具调用弱

模型版本

cogvlm2-llama3-chat-19B19B(英文)cogvlm2-llama3-chinese-chat-19B19B(中英双语)cogvlm2-llama3-chat-19B-int419B int4,约16GB显存

模型获取

部署方式

transformersvLLMLMDeploy

显存需求

19B FP16约42GB(官方)
19B int4约16GB(官方)

硬件推荐

RTX 3060显存不足,19B 需 16G+
RTX 3090int4 约16GB 勉强可跑
RTX 4090int4 流畅,FP16 不足
RTX 5090可尝试 FP16(约42GB,需多卡)
Mac需 64GB+ 统一内存,体验一般

推荐配置

入门RTX 3090 24G + 19B-int4(约16GB)
进阶RTX 4090 24G + 19B-int4
专业A100/H100 80G + 19B FP16 或双卡

为什么选择这个模型

  • 视觉-语言深度融合架构,图文交互质量高
  • 官方 int4 权重 16GB 显存可部署
  • 中文版文档/图表理解表现好
  • 清华系背书,学术社区资料完整

模型优点

  • TextVQA/DocVQA 等文档基准提升显著
  • 1344×1344 高分辨率图像输入
  • 提供中英双语版本
  • int4 官方量化,显存门槛可控

模型缺点

  • 19B 参数量导致单卡 FP16 门槛高(约42GB)
  • 上下文仅 8K,长图文受限
  • 自定义许可+Llama3 条款叠加,商用手续较繁琐
  • 社区生态与教程少于 Qwen-VL/InternVL

适合场景

  • 文档/截图/票据 OCR 与版面理解
  • 视觉对话研究(深度融合架构参照)
  • 中文多模态问答与知识问答
  • 企业级私有化视觉服务(int4)

不适合场景

  • 低显存(<16GB)单机部署
  • 超长图文上下文任务
  • 需要 Ollama 一键部署的轻量场景
  • 严格 Apache/MIT 许可要求的商用项目

部署教程

Ollama
官方未上架库,社区 GGUF 不完整,建议用 transformers/LMDeploy 部署
LM Studio
LM Studio 暂无官方 GGUF,可等社区转换
llama.cpp
暂无官方 llama.cpp 支持,建议 vLLM/transformers
vLLM
pip install vllm && vllm serve THUDM/cogvlm2-llama3-chat-19B --quantization awq

智算工坊实验室

实测速度19B int4 ≈12-15 token/s(RTX 4090 实测参考)
显存占用FP16 约42GB;int4 约16GB
功耗整机约350W
不同 GPU 对比3090/4090 跑 int4,FP16 需 80GB 级单卡或双卡

常见问题 FAQ

CogVLM2 与 CogVLM 第一代有什么区别?

CogVLM2 换成 Llama3 基座,总参约19B,TextVQA/DocVQA 等文档基准大幅提升,并支持 8K 上下文与 1344×1344 图像。

它和其他开源多模态怎么选?

看重图文深度融合质量与清华系研究参考选 CogVLM2;要更低显存选 MiniCPM-V;要更强 OCR 与多尺寸选 InternVL2.5。

相关模型

相关工具

相关硬件

数据来源

  • https://huggingface.co/zai-org/cogvlm2-llama3-chat-19B
  • https://huggingface.co/THUDM/cogvlm2-llama3-chat-19B
  • https://github.com/zai-org/CogVLM2