MiniMax 系列

★★★★★ 4.5 分

MiniMax 开源的 456B MoE 大模型,拥有超长上下文,Agent 与代码能力突出,适合企业级长文本与智能体场景。

中文MoE开源长文本
参数量MiniMax-01(456B MoE)/ MiniMax-M1
模型类型对话 + 推理大语言模型(MoE)
许可证MiniMax 开源协议
开发者MiniMax(稀宇科技)
★★★★★ 4.5

超长上下文与Agent新势力

中文MoE超长上下文Agent

模型介绍

MiniMax 是国内稀宇科技出品的多模态大模型系列,以「超长上下文 + Agent」突围:2025 年 1 月开源 MiniMax-Text-01,是全球首个提供 4M(400 万)级上下文窗口的 MoE 模型之一(456B-A46B);2025-2026 年迭代的 MiniMax-M2/M3 进一步把规模控制在 428B~456B(激活 23B~46B),并原生支持多模态输入。其长文档、长视频理解与智能体工具调用能力在国产开源中属于第一梯队,适合企业级长文本与 RAG 应用。

模型基本信息

开发机构MiniMax(稀宇科技)
模型版本MiniMax-M3(2026)/ M2 / Text-01
参数规模Text-01 456B-A46B MoE;M2 456B-A46B;M3 428B-A23B MoE
模型类型文本对话 / 多模态(M3)
许可证自定义许可(可商用,非 OSI)
上下文长度1M(M2/M3);4M(Text-01 宣传)
发布日期2025-01-12(MiniMax-Text-01);2026-06-02(MiniMax-M3)
模型架构Transformer + 稀疏 MoE + Lightning Attention 线性注意力(Text-01/M2);M3 采用 MSA 稀疏注意力 + MiniMaxM3Sparse 架构

模型能力

中文能力很强
英文能力很强
代码能力强
推理能力强
长文本能力很强(1M~4M)
视觉能力强(M3 原生多模态)
工具调用很强(Agent)

模型版本

MiniMax-M3428B-A23B MoEMiniMax-M2456B-A46B MoEMiniMax-Text-01456B-A46B MoEMiniMax-M1456B(早期全注意力)

模型获取

部署方式

vLLMSGLangtransformers

显存需求

MiniMax-M1/Text-01(FP8)集群约500GB+
MiniMax-M3(FP8)集群约450GB+

硬件推荐

RTX 3060/3090/4090/5090不可本地部署,建议 API 接入
Mac不可本地部署,建议 API 接入

推荐配置

入门直接调用官方 API(无消费级本地方案)
进阶企业级:A100/H100 ×8 集群跑 MiniMax-M3(FP8)
专业H100 ×16+,配合长上下文 RAG 与智能体编排

为什么选择这个模型

  • 国产 MoE 中上下文最长阵营之一
  • 长程 Agent 与工具调用能力突出
  • 原生多模态(M3)丰富场景
  • 与海螺/Hailuo 视频生态联动

模型优点

  • 1M~4M 超长上下文
  • 智能体规划与代码能力
  • M3 原生多模态
  • 稀疏注意力推理高效
  • 中文与多语言均衡

模型缺点

  • 旗舰参数庞大,无法在消费级部署
  • 许可非 OSI 开源
  • 社区与教程相对较少
  • 显存与硬件成本极高

适合场景

  • 超长文档 / 长视频理解
  • 企业级 RAG 与知识库
  • 智能体 (Agent) 工作流
  • 长上下文 API 集成
  • 多模态长文档(M3)

不适合场景

  • 个人本地部署
  • 严格 OSI 合规项目
  • 低成本轻量对话
  • 端侧设备

部署教程

Ollama
不适用(无 Ollama 标签),走官方 API: https://platform.minimaxi.com
LM Studio
不适用(体积过大)
llama.cpp
不适用(体积过大)
vLLM
企业部署:pip install vllm && vllm serve MiniMaxAI/MiniMax-M3-instruct --tensor-parallel-size 8

智算工坊实验室

实测速度无消费级实测数据(模型需集群)
显存占用API / 集群方案
功耗集群功耗数千瓦级
不同 GPU 对比不适用消费级 GPU 对比

常见问题 FAQ

MiniMax 本地能跑吗?

428B~456B 的 MoE 需数十张 A100/H100,个人电脑无法运行;官方提供 API,本地社区极少量化尝试。

M3 和 M2 区别?

M3(2026-06)更侧重效率(激活降为 23B/每 token)并原生多模态;M2(2025)上下文更长。选择取决于你更看重速度还是上下文。

相关模型

相关工具

相关硬件

数据来源

  • https://huggingface.co/MiniMaxAI/MiniMax-01
  • https://huggingface.co/MiniMaxAI/MiniMax-M3
  • https://www.minimax.io/
  • https://platform.minimaxi.com/