超长上下文与Agent新势力
模型介绍
MiniMax 是国内稀宇科技出品的多模态大模型系列,以「超长上下文 + Agent」突围:2025 年 1 月开源 MiniMax-Text-01,是全球首个提供 4M(400 万)级上下文窗口的 MoE 模型之一(456B-A46B);2025-2026 年迭代的 MiniMax-M2/M3 进一步把规模控制在 428B~456B(激活 23B~46B),并原生支持多模态输入。其长文档、长视频理解与智能体工具调用能力在国产开源中属于第一梯队,适合企业级长文本与 RAG 应用。
模型基本信息
开发机构MiniMax(稀宇科技)
模型版本MiniMax-M3(2026)/ M2 / Text-01
参数规模Text-01 456B-A46B MoE;M2 456B-A46B;M3 428B-A23B MoE
模型类型文本对话 / 多模态(M3)
许可证自定义许可(可商用,非 OSI)
上下文长度1M(M2/M3);4M(Text-01 宣传)
发布日期2025-01-12(MiniMax-Text-01);2026-06-02(MiniMax-M3)
模型架构Transformer + 稀疏 MoE + Lightning Attention 线性注意力(Text-01/M2);M3 采用 MSA 稀疏注意力 + MiniMaxM3Sparse 架构
模型能力
中文能力很强
英文能力很强
代码能力强
推理能力强
长文本能力很强(1M~4M)
视觉能力强(M3 原生多模态)
工具调用很强(Agent)
模型版本
MiniMax-M3428B-A23B MoEMiniMax-M2456B-A46B MoEMiniMax-Text-01456B-A46B MoEMiniMax-M1456B(早期全注意力)
模型获取
部署方式
vLLMSGLangtransformers
显存需求
MiniMax-M1/Text-01(FP8)集群约500GB+
MiniMax-M3(FP8)集群约450GB+
硬件推荐
RTX 3060/3090/4090/5090不可本地部署,建议 API 接入
Mac不可本地部署,建议 API 接入
推荐配置
入门直接调用官方 API(无消费级本地方案)
进阶企业级:A100/H100 ×8 集群跑 MiniMax-M3(FP8)
专业H100 ×16+,配合长上下文 RAG 与智能体编排
为什么选择这个模型
- 国产 MoE 中上下文最长阵营之一
- 长程 Agent 与工具调用能力突出
- 原生多模态(M3)丰富场景
- 与海螺/Hailuo 视频生态联动
模型优点
- 1M~4M 超长上下文
- 智能体规划与代码能力
- M3 原生多模态
- 稀疏注意力推理高效
- 中文与多语言均衡
模型缺点
- 旗舰参数庞大,无法在消费级部署
- 许可非 OSI 开源
- 社区与教程相对较少
- 显存与硬件成本极高
适合场景
- 超长文档 / 长视频理解
- 企业级 RAG 与知识库
- 智能体 (Agent) 工作流
- 长上下文 API 集成
- 多模态长文档(M3)
不适合场景
- 个人本地部署
- 严格 OSI 合规项目
- 低成本轻量对话
- 端侧设备
部署教程
Ollama
不适用(无 Ollama 标签),走官方 API: https://platform.minimaxi.com
LM Studio
不适用(体积过大)
llama.cpp
不适用(体积过大)
vLLM
企业部署:pip install vllm && vllm serve MiniMaxAI/MiniMax-M3-instruct --tensor-parallel-size 8
智算工坊实验室
实测速度无消费级实测数据(模型需集群)
显存占用API / 集群方案
功耗集群功耗数千瓦级
不同 GPU 对比不适用消费级 GPU 对比
常见问题 FAQ
MiniMax 本地能跑吗?
428B~456B 的 MoE 需数十张 A100/H100,个人电脑无法运行;官方提供 API,本地社区极少量化尝试。
M3 和 M2 区别?
M3(2026-06)更侧重效率(激活降为 23B/每 token)并原生多模态;M2(2025)上下文更长。选择取决于你更看重速度还是上下文。
相关模型
相关工具
相关硬件
数据来源
- https://huggingface.co/MiniMaxAI/MiniMax-01
- https://huggingface.co/MiniMaxAI/MiniMax-M3
- https://www.minimax.io/
- https://platform.minimaxi.com/