2.8T MoE 长程Agent前沿
模型介绍
Kimi 出自月之暗面(Moonshot AI),以超长上下文与深度 Agent 能力著称。2025 年 7 月开源的 Kimi-K2 以 1T(万亿)参数 MoE + 256K 上下文成为当时重量级开源选择,并提供 7B/32B 蒸馏版供消费级部署;2026 年的 Kimi-K3 将总参数推至 2.8T(激活 104B)、上下文扩到 1M,并原生支持视觉。Kimi 强调「长程任务」:可读取整本学术论文、数千行代码库,并在长程 Agent 评测中名列前茅,蒸馏版让本地用户也能尝鲜超长上下文。
模型基本信息
开发机构月之暗面(Moonshot AI)
模型版本Kimi-K3(2026)/ K2
参数规模K2 1T-A32B MoE;K2-Thinking 1T-A32B;K3 2.8T-A104B MoE;蒸馏 7B
模型类型文本对话 / 推理 / 长程 Agent
许可证Kimi 开源许可(自定义,允许商用)
上下文长度256K(K2);1M(K3);Ollama/本地蒸馏版 32K~128K
发布日期2025-07-11(Kimi-K2-Instruct);2026-06-13(Kimi-K3)
模型架构MoE Transformer(DeepseekV3 派生架构)+ KDA 注意力(K3);蒸馏版为 Qwen 架构
模型能力
中文能力很强
英文能力很强
代码能力很强
推理能力很强
长文本能力很强(256K~1M)
视觉能力强(K3 原生视觉)
工具调用很强(长程 Agent)
模型版本
Kimi-K32.8T-A104B MoEKimi-K2-Thinking1T-A32B MoEKimi-K2-Instruct-09051T-A32B MoEKimi-K2-Distill-7B7B 蒸馏(消费级)
模型获取
部署方式
vLLMSGLangtransformersOllamallama.cpp
显存需求
Kimi-K2-Distill-7B Q4约6GB
Kimi-K2(FP8)集群约600GB+
Kimi-K3需大规模集群
硬件推荐
RTX 3060K2-Distill-7B(Q4)
RTX 3090蒸馏 7B~14B
RTX 4090蒸馏 7B~32B(Q4)
RTX 5090蒸馏 32B FP16
MacM 系列可跑蒸馏 7B~32B
推荐配置
入门RTX 3060 12G + Kimi-K2-Distill-7B Q4 约6GB
进阶RTX 4090 24G + Kimi-K2-Distill-32B Q4(约20GB)
专业A100/H100 ×8 + Kimi-K2 / K3 集群(FP8)
为什么选择这个模型
- 开源中最大规模(2.8T)与超长上下文体验
- 长程 Agent 与代码库级推理能力
- 蒸馏版让超长上下文在消费级机器也能尝试
- 月之暗面持续投入,社区关注度高
模型优点
- 256K~1M 超长上下文
- 长程 Agent 与工具链强
- K3 原生多模态
- K2 中文评测优秀
- 蒸馏版本地门槛低
模型缺点
- 旗舰 1T/2.8T 需集群,个人不可行
- 许可为自定义(非 OSI)
- 蒸馏版能力与旗舰差距大
- 超长上下文推理 token 消耗高
适合场景
- 整篇论文 / 代码库分析
- 长程 Agent 工作流
- 研究与学术助手
- 超长日志与文档摘要
- API 集成长文档场景
不适合场景
- 消费级单卡跑旗舰 K2/K3
- 对延迟敏感的低成本任务
- 严格 OSI 合规项目
- 移动端
部署教程
Ollama
蒸馏版:从 HF 下载 GGUF 后 ollama create 自定义模型;旗舰版建议走官方 API
LM Studio
LM Studio 支持加载 Kimi-K2 蒸馏 GGUF(需自行转换 32K 上下文)
llama.cpp
蒸馏版:llama-cli -m kimi-k2-distill-7b-q4_k_m.gguf -c 32768 -p 提示词
vLLM
旗舰版:pip install vllm && vllm serve moonshotai/Kimi-K2-Instruct-AWQ(需多卡)
智算工坊实验室
实测速度蒸馏 7B Q4 ≈35-40 token/s(RTX 3060);旗舰无消费级数据
显存占用蒸馏 7B Q4 约6GB
功耗RTX 3060 满载约170W
不同 GPU 对比超长上下文(≥32K)下 prompt 预处理显著增加,显存占用随上下文线性上升,需预留更大 KV Cache
常见问题 FAQ
Kimi 本地部署现实吗?
旗舰 K2/K3 需要 A100/H100 集群;推荐本地跑蒸馏 7B/32B 体验,或直接用月之暗面 API 享受完整超长上下文。
K2 与 K3 我该关注哪个?
K3 更新(2.8T、1M、原生视觉),能力更强但更吃算力;K2 已是成熟开源旗舰,蒸馏版也更完善。
相关模型
相关工具
相关硬件
相关文章
数据来源
- https://huggingface.co/moonshotai/Kimi-K2-Instruct-0905
- https://huggingface.co/moonshotai/Kimi-K3
- https://platform.moonshot.cn/docs/pricing/chat
- https://www.kimi.com/