欧洲最强开源厂牌,MoE 稀疏算力先锋
模型介绍
Mistral AI 是法国的开源大模型旗舰厂牌,以极致高效的 MoE 稀疏架构闻名:2023 年的 Mistral 7B 一度是 7B 尺寸的王者,Mixtral 8x7B/8x22B 则证明了「稀疏激活」能以更低成本逼近大规模稠密模型。2025 年的 Mistral Small 3.2(24B)以几乎媲美 70B 的能力成为中小部署的明星,2026 年的 Mistral Small 4(119B MoE)更强推理并原生支持多模态。全家族 Apache-2.0 授权、对欧洲语言出色,是英文与多语言产品线的务实选择。
模型基本信息
开发机构Mistral AI(法国)
模型版本Mistral Small 4(2026)/ Small 3.2 / Mixtral
参数规模7B 稠密;8x7B/8x22B MoE;Small 3.2 24B;Small 4 119B-A6.5B MoE
模型类型文本对话 / 推理(Small 4 支持图像)
许可证apache-2.0
上下文长度128K(Small 3.2/4 支持);32K(7B v0.3)
发布日期2024-05-22(Mistral-7B-Instruct-v0.3);2025-06-19(Small 3.2-24B);2026-01-23(Small 4-119B)
模型架构Decoder-only Transformer + GQA;Mixtral/Small 4 为稀疏 MoE(128 专家激活 6 个)
模型能力
中文能力中
英文能力很强
代码能力很强
推理能力很强
长文本能力强(128K)
视觉能力强(Small 4 支持图像)
工具调用很强
模型版本
Mistral-Small-4-119B119B-A6.5B MoELeanstral-1.5-119B-A6B119B-A6B MoE(2026)Mistral-Small-3.2-24B24B 稠密(性价比明星)Mixtral-8x22B8x22B MoE(141B 总参)Mistral-7B-Instruct-v0.37B 稠密
模型获取
部署方式
OllamaLM Studiollama.cppvLLMSGLangtransformers
显存需求
Mistral-7B Q4约5GB
Small-3.2-24B Q4约15GB
Mixtral-8x22B Q4约50GB(多卡)
Small-4-119B Q4约70GB(多卡/集群)
硬件推荐
RTX 3060Mistral 7B(Q4)
RTX 30907B~24B(Q4 约15GB)
RTX 409024B Q4 舒适
RTX 509024B FP16 / 多卡跑 Mixtral 8x22B
MacM 系列可跑 7B~24B
推荐配置
入门RTX 3060 12G + Mistral-7B Q4 约5GB
进阶RTX 4090 24G + Small-3.2-24B Q4 约15GB
专业RTX 5090 ×2 / A100 集群 + Small 4 119B / Mixtral 8x22B
为什么选择这个模型
- MoE 稀疏架构效率领先
- 24B 平替 70B 的经典性价比之选
- Apache-2.0 全家族可商用
- European 多语言与英文表现优秀
模型优点
- 7B 同尺寸标杆
- Small 3.2 (24B) 逼近 70B 能力
- 原生函数调用与工具生态(Function Calling 规范)
- Apache-2.0
- Le Chat 平台可直接试用
模型缺点
- 中文明显弱于国产模型
- 英文一支独大,多语言靠课本语言
- Mixtral/119B 部署较复杂
- 文档与社区以英文为主
适合场景
- 英文产品 / 多语言站点
- Agent 与函数调用
- 企业私有化(Apache)
- 代码辅助
- 24GB 显存想上大模型
不适合场景
- 中文深度内容生成
- 中文 RAG 长文本
- 单卡 24G 内跑 119B
- 任务更偏国产化多模态
部署教程
Ollama
ollama run mistral-small:24b
LM Studio
LM Studio 搜索 mistral-small-24b 下载 GGUF → 加载 → 开启长上下文
llama.cpp
./llama-cli -m mistral-small-24b-instruct-q4_k_m.gguf -p 提示词 -ngl 999
vLLM
pip install vllm && vllm serve mistralai/Mistral-Small-3.2-24B-Instruct-2506
智算工坊实验室
实测速度Mistral-7B Q4 ≈40 token/s;Small-3.2-24B Q4 ≈25-30 token/s(RTX 4090)
显存占用7B Q4 约5GB;24B Q4 约15GB
功耗RTX 4090 满载约450W
不同 GPU 对比24B 在 3090 与 4090 差距约 15%;MoE 的 8x22B 与 119B 需多卡显存分配
常见问题 FAQ
Mistral Small 3.2 真的能平替 70B 吗?
多项基准(数学/SWE)已接近甚至超过部分 70B 模型,而 Q4 只需约 15GB 显存,对 24GB 用户是很有吸引力的 70B 平替。
MoE 在本地有什么注意?
MoE 总参数量大,模型文件体积按总参数算,但推理显存按激活层算;Q4 的 Mixtral 8x7B 文件约 27GB、激活约 13GB,适合 16~24GB 显存。
相关模型
相关工具
相关硬件
相关文章
数据来源
- https://huggingface.co/mistralai/Mistral-7B-Instruct-v0.3
- https://huggingface.co/mistralai/Mistral-Small-3.2-24B-Instruct-2506
- https://mistral.ai/news/
- https://huggingface.co/mistralai/Mistral-Small-4-119B-2603