零一万物轻量中文视觉模型,低门槛入门之选
模型介绍
Yi-VL 是零一万物(01.AI)基于 Yi 语言模型构建的中文视觉语言模型,采用 CLIP-ViT-H 视觉编码器配 LLaVA 式 MLP 投影,将图像特征映射到 Yi-6B/34B 语言空间。Yi-VL-6B 轻量版约 6B 参数、Apache-2.0 许可,Q4 量化后仅约 5GB 显存,12GB 显卡即可流畅本地运行;Yi-VL-34B 提供更强的视觉理解。它定位「中文图文理解均衡」,适合低配置电脑上的视觉对话、图文问答与入门实验。
模型基本信息
开发机构零一万物(01.AI)
模型版本Yi-VL(6B / 34B)
参数规模6B(另有 34B)
模型类型多模态视觉语言模型(LLaVA 架构)
许可证Apache-2.0
上下文长度4K
发布日期2024-01(Yi-VL 发布);HF 仓库 2023-12-25
模型架构CLIP ViT-H/14 视觉编码器 + MLP 投影 + Yi-6B/34B 语言模型
模型能力
中文能力强
英文能力中
代码能力中
推理能力中
长文本能力弱
视觉能力中
工具调用弱
模型版本
Yi-VL-6B6B(轻量)Yi-VL-34B34B(更强视觉)
模型获取
部署方式
transformersvLLMLM Studio
显存需求
6B FP16约13GB
6B Q4约5GB
硬件推荐
RTX 30606B Q4 约5GB 可跑
RTX 30906B 原生流畅
RTX 40906B 原生 / 34B Q4
RTX 509034B 原生/多卡
Mac16GB 内存可跑 6B Q4
推荐配置
入门RTX 3060 12G + Yi-VL-6B Q4(约5GB)
进阶RTX 3090/4090 + Yi-VL-6B 原生
专业RTX 5090/A100 + Yi-VL-34B
为什么选择这个模型
- 6B 轻量 + Q4 仅约5GB,低配显卡/笔记本可跑
- Apache-2.0 许可,商用无忧
- 中文图文理解均衡,中文提示词友好
- 零一万物生态背景,代码与文档规范
模型优点
- 轻量端侧友好,部署门槛极低
- Apache-2.0 全责商用
- 中文多模态对话与图文问答体验可用
- HF/ModelScope 双平台提供,国内下载方便
模型缺点
- 视觉基准落后于 InternVL2.5/Qwen2.5-VL
- 4K 上下文,长图文受限
- 官方迭代放缓,新特性少
- 社区生态与教程较少,量化资源不丰富
适合场景
- 本地低显存视觉问答入门
- 中文图文对话实验与教学
- 轻量级截图/图片理解工具
- Apache-2.0 商用场景的过渡方案
不适合场景
- 高精度 OCR 与密集文档解析
- 复杂图表/数学推理
- 长文档多图理解
- 追求最新 SOTA 的视觉任务
部署教程
Ollama
官方未上架 Ollama 库,可从 HF 下载后用 LM Studio/transformers 加载
LM Studio
LM Studio 搜索 Yi-VL 社区 GGUF 或直接导入 transformers 权重
llama.cpp
暂无官方 llama.cpp 支持,建议 transformers/vLLM
vLLM
pip install vllm && vllm serve 01-ai/Yi-VL-6B
智算工坊实验室
实测速度6B Q4 ≈35-45 token/s(RTX 4090 实测参考)
显存占用6B FP16 约13GB;Q4 约5GB
功耗整机约250W
不同 GPU 对比3060 跑 6B Q4 流畅,24GB 卡可上 34B Q4
常见问题 FAQ
Yi-VL 与 Qwen2.5-VL 如何选择?
二者都适合中文场景;追求最新性能与生态选 Qwen2.5-VL,注重轻量入门与极低显存可选 Yi-VL-6B。
Yi-VL 还值得新项目选用吗?
作为入门/教学与低配置实验可用;生产级中文视觉建议 InternVL2.5 或 Qwen2.5-VL。
相关模型
相关工具
相关硬件
数据来源
- https://huggingface.co/01-ai/Yi-VL-6B
- https://modelscope.cn/models/01ai/Yi-VL-6B
- https://www.lingyiwanwu.com/