Mistral 系列

★★★★★ 4.6 分

欧洲最强开源模型厂牌,8x7B/8x22B MoE 架构在 24GB 级别用稀疏算力吊打同尺寸稠密模型,Apache 许可适合商用。

欧洲MoE指令微调开源
参数量7B / 8B / 12B / 24B / 123B(MoE)
模型类型通用/指令大语言模型(含 8x7B MoE)
许可证Apache 2.0(多数版本)
开发者Mistral AI(法国)
★★★★★ 4.7

欧洲最强开源厂牌,MoE 稀疏算力先锋

英文MoE开源推理

模型介绍

Mistral AI 是法国的开源大模型旗舰厂牌,以极致高效的 MoE 稀疏架构闻名:2023 年的 Mistral 7B 一度是 7B 尺寸的王者,Mixtral 8x7B/8x22B 则证明了「稀疏激活」能以更低成本逼近大规模稠密模型。2025 年的 Mistral Small 3.2(24B)以几乎媲美 70B 的能力成为中小部署的明星,2026 年的 Mistral Small 4(119B MoE)更强推理并原生支持多模态。全家族 Apache-2.0 授权、对欧洲语言出色,是英文与多语言产品线的务实选择。

模型基本信息

开发机构Mistral AI(法国)
模型版本Mistral Small 4(2026)/ Small 3.2 / Mixtral
参数规模7B 稠密;8x7B/8x22B MoE;Small 3.2 24B;Small 4 119B-A6.5B MoE
模型类型文本对话 / 推理(Small 4 支持图像)
许可证apache-2.0
上下文长度128K(Small 3.2/4 支持);32K(7B v0.3)
发布日期2024-05-22(Mistral-7B-Instruct-v0.3);2025-06-19(Small 3.2-24B);2026-01-23(Small 4-119B)
模型架构Decoder-only Transformer + GQA;Mixtral/Small 4 为稀疏 MoE(128 专家激活 6 个)

模型能力

中文能力中
英文能力很强
代码能力很强
推理能力很强
长文本能力强(128K)
视觉能力强(Small 4 支持图像)
工具调用很强

模型版本

Mistral-Small-4-119B119B-A6.5B MoELeanstral-1.5-119B-A6B119B-A6B MoE(2026)Mistral-Small-3.2-24B24B 稠密(性价比明星)Mixtral-8x22B8x22B MoE(141B 总参)Mistral-7B-Instruct-v0.37B 稠密

模型获取

部署方式

OllamaLM Studiollama.cppvLLMSGLangtransformers

显存需求

Mistral-7B Q4约5GB
Small-3.2-24B Q4约15GB
Mixtral-8x22B Q4约50GB(多卡)
Small-4-119B Q4约70GB(多卡/集群)

硬件推荐

RTX 3060Mistral 7B(Q4)
RTX 30907B~24B(Q4 约15GB)
RTX 409024B Q4 舒适
RTX 509024B FP16 / 多卡跑 Mixtral 8x22B
MacM 系列可跑 7B~24B

推荐配置

入门RTX 3060 12G + Mistral-7B Q4 约5GB
进阶RTX 4090 24G + Small-3.2-24B Q4 约15GB
专业RTX 5090 ×2 / A100 集群 + Small 4 119B / Mixtral 8x22B

为什么选择这个模型

  • MoE 稀疏架构效率领先
  • 24B 平替 70B 的经典性价比之选
  • Apache-2.0 全家族可商用
  • European 多语言与英文表现优秀

模型优点

  • 7B 同尺寸标杆
  • Small 3.2 (24B) 逼近 70B 能力
  • 原生函数调用与工具生态(Function Calling 规范)
  • Apache-2.0
  • Le Chat 平台可直接试用

模型缺点

  • 中文明显弱于国产模型
  • 英文一支独大,多语言靠课本语言
  • Mixtral/119B 部署较复杂
  • 文档与社区以英文为主

适合场景

  • 英文产品 / 多语言站点
  • Agent 与函数调用
  • 企业私有化(Apache)
  • 代码辅助
  • 24GB 显存想上大模型

不适合场景

  • 中文深度内容生成
  • 中文 RAG 长文本
  • 单卡 24G 内跑 119B
  • 任务更偏国产化多模态

部署教程

Ollama
ollama run mistral-small:24b
LM Studio
LM Studio 搜索 mistral-small-24b 下载 GGUF → 加载 → 开启长上下文
llama.cpp
./llama-cli -m mistral-small-24b-instruct-q4_k_m.gguf -p 提示词 -ngl 999
vLLM
pip install vllm && vllm serve mistralai/Mistral-Small-3.2-24B-Instruct-2506

智算工坊实验室

实测速度Mistral-7B Q4 ≈40 token/s;Small-3.2-24B Q4 ≈25-30 token/s(RTX 4090)
显存占用7B Q4 约5GB;24B Q4 约15GB
功耗RTX 4090 满载约450W
不同 GPU 对比24B 在 3090 与 4090 差距约 15%;MoE 的 8x22B 与 119B 需多卡显存分配
→ 查看实验室数据

常见问题 FAQ

Mistral Small 3.2 真的能平替 70B 吗?

多项基准(数学/SWE)已接近甚至超过部分 70B 模型,而 Q4 只需约 15GB 显存,对 24GB 用户是很有吸引力的 70B 平替。

MoE 在本地有什么注意?

MoE 总参数量大,模型文件体积按总参数算,但推理显存按激活层算;Q4 的 Mixtral 8x7B 文件约 27GB、激活约 13GB,适合 16~24GB 显存。

相关模型

相关工具

相关硬件

相关文章

数据来源

  • https://huggingface.co/mistralai/Mistral-7B-Instruct-v0.3
  • https://huggingface.co/mistralai/Mistral-Small-3.2-24B-Instruct-2506
  • https://mistral.ai/news/
  • https://huggingface.co/mistralai/Mistral-Small-4-119B-2603