国产老牌中文轻部署经典
模型介绍
Baichuan(百川智能)是国内最早一批开源大模型的团队,2023 年的 Baichuan-7B/13B 与 Baichuan2 系列以扎实的中文能力成为当时学术复现与轻部署的经典之选。2025 年起团队主力转向闭源商业模型(Baichuan-M1/M2/M3),其中 M3 采用 Qwen3-MoE 基座并开源权重(Apache-2.0),专攻医疗等领域。对入门用户而言,Baichuan2 的 7B 仍是简单可用的中文基线;老牌生态与文档也较完整。
模型基本信息
开发机构百川智能(Baichuan)
模型版本Baichuan2 / Baichuan-M3
参数规模Baichuan2-7B/13B;Baichuan-M1-100B-A20B MoE;Baichuan-M3-235B(医疗)
模型类型文本对话 / 中文通用大模型
许可证Apache-2.0(Baichuan-M 系列);Baichuan2 为自定义社区许可
上下文长度32K(Baichuan2);128K(M 系列)
发布日期2023-08-29(Baichuan2-7B-Chat);2026-01-13(Baichuan-M3-235B)
模型架构Baichuan 自研 Transformer(RoPE + GQA + Long LoRA 等);M 系列基于 Qwen3-MoE 架构(Qwen3MoeForCausalLM)
模型能力
中文能力很强
英文能力中
代码能力中
推理能力中
长文本能力中(32K);M 系列强
视觉能力弱(纯文本,另有 Baichuan-VL)
工具调用中
模型版本
Baichuan-M3-235B235B(医疗领域)Baichuan-M1-100B-A20B100B-A20B MoEBaichuan2-13B-Chat13BBaichuan2-7B-Chat7BBaichuan-7B7B(第一代)
模型获取
部署方式
OllamaLM Studiollama.cppvLLMtransformers
显存需求
Baichuan2-7B Q4约5GB
Baichuan2-13B Q4约9GB
Baichuan-M1-100B Q4约55GB(多卡)
硬件推荐
RTX 3060Baichuan2-7B(Q4)
RTX 3090Baichuan2-13B(Q4)
RTX 409013B 舒适;M1 需多卡
RTX 5090M1 量化多卡方案
MacM 系列 7B/13B 流畅
推荐配置
入门RTX 3060 12G + Baichuan2-7B Q4 约5GB
进阶RTX 3090/4090 24G + Baichuan2-13B Q4 约9GB
专业多卡 A100/H100 + Baichuan-M1-100B / M3-235B
为什么选择这个模型
- 老牌中文团队,文档完整
- 7B/13B 经典尺寸部署门槛低
- Apache-2.0(M 系列)
- 与百川商业 API 同源可平滑升级
模型优点
- 中文能力稳定
- 7B/13B 轻量易部署
- 学术与教材引用多
- M 系列开源权重
- API 国内直连快
模型缺点
- 主力重心转向闭源,开源更新慢
- Baichuan2 许可非 OSI
- 英文与代码一般
- 生态活跃度下降
适合场景
- 中文问答/客服中文优先场景
- 轻量私有化(7B/13B)
- 教学演示
- 从 GGUF 库快速试用
- 医疗等垂直基线(M3)
不适合场景
- 前沿推理基准
- 代码优先产品
- 需要活跃社区生态
- 英文为主的国际化应用
部署教程
Ollama
官方无库标签,可用社区 GGUF:ollama run mmprole/baichuan2-7b(社区)
LM Studio
LM Studio 搜索 baichuan GGUF(TheBloke 等镜像)→ 加载
llama.cpp
./llama-cli -m baichuan2-7b-chat-q4_k_m.gguf -p 提示词 -ngl 999
vLLM
pip install vllm && vllm serve baichuan-inc/Baichuan2-7B-Chat
智算工坊实验室
实测速度Baichuan2-7B Q4 实测 ≈40 token/s(RTX 3060)
显存占用7B Q4 约5GB;13B Q4 约9GB
功耗RTX 3060 满载约170W
不同 GPU 对比7B 在低端卡即可满速;13B 建议 12GB+
常见问题 FAQ
Baichuan2 与 Baichuan-M 怎么选?
本地轻部署选 Baichuan2-7B/13B;若需要开源 MoE 能力(100B/235B)选 M 系列,但需多卡或集群。
是否还值得从 Baichuan 入门?
适合中文基线/教学;追新能力建议选 Qwen 或 GLM 的新一代开源模型。
相关模型
相关工具
相关硬件
NVIDIA GeForce RTX 3060 12GBNVIDIA GeForce RTX 3090NVIDIA GeForce RTX 4090Apple Mac Studio (M4 Ultra)
数据来源
- https://huggingface.co/baichuan-inc/Baichuan2-7B-Chat
- https://huggingface.co/baichuan-inc/Baichuan-M3-235B
- https://www.baichuan-ai.com/