Kimi 系列(月之暗面)

★★★★★ 4.7 分

月之暗面开源的 MoE 大模型,以超长上下文与深度推理著称,K2 蒸馏版支持本地部署,是国产推理模型新势力。

中文长文本推理MoE
参数量Kimi K2(MoE 1T,开源)/ Kimi 长文本 API
模型类型对话 + 推理大语言模型(MoE 架构)
许可证Modified MIT(K2 开源)
开发者月之暗面(Moonshot AI)
★★★★★ 4.8

2.8T MoE 长程Agent前沿

中文超长上下文MoEAgent

模型介绍

Kimi 出自月之暗面(Moonshot AI),以超长上下文与深度 Agent 能力著称。2025 年 7 月开源的 Kimi-K2 以 1T(万亿)参数 MoE + 256K 上下文成为当时重量级开源选择,并提供 7B/32B 蒸馏版供消费级部署;2026 年的 Kimi-K3 将总参数推至 2.8T(激活 104B)、上下文扩到 1M,并原生支持视觉。Kimi 强调「长程任务」:可读取整本学术论文、数千行代码库,并在长程 Agent 评测中名列前茅,蒸馏版让本地用户也能尝鲜超长上下文。

模型基本信息

开发机构月之暗面(Moonshot AI)
模型版本Kimi-K3(2026)/ K2
参数规模K2 1T-A32B MoE;K2-Thinking 1T-A32B;K3 2.8T-A104B MoE;蒸馏 7B
模型类型文本对话 / 推理 / 长程 Agent
许可证Kimi 开源许可(自定义,允许商用)
上下文长度256K(K2);1M(K3);Ollama/本地蒸馏版 32K~128K
发布日期2025-07-11(Kimi-K2-Instruct);2026-06-13(Kimi-K3)
模型架构MoE Transformer(DeepseekV3 派生架构)+ KDA 注意力(K3);蒸馏版为 Qwen 架构

模型能力

中文能力很强
英文能力很强
代码能力很强
推理能力很强
长文本能力很强(256K~1M)
视觉能力强(K3 原生视觉)
工具调用很强(长程 Agent)

模型版本

Kimi-K32.8T-A104B MoEKimi-K2-Thinking1T-A32B MoEKimi-K2-Instruct-09051T-A32B MoEKimi-K2-Distill-7B7B 蒸馏(消费级)

模型获取

部署方式

vLLMSGLangtransformersOllamallama.cpp

显存需求

Kimi-K2-Distill-7B Q4约6GB
Kimi-K2(FP8)集群约600GB+
Kimi-K3需大规模集群

硬件推荐

RTX 3060K2-Distill-7B(Q4)
RTX 3090蒸馏 7B~14B
RTX 4090蒸馏 7B~32B(Q4)
RTX 5090蒸馏 32B FP16
MacM 系列可跑蒸馏 7B~32B

推荐配置

入门RTX 3060 12G + Kimi-K2-Distill-7B Q4 约6GB
进阶RTX 4090 24G + Kimi-K2-Distill-32B Q4(约20GB)
专业A100/H100 ×8 + Kimi-K2 / K3 集群(FP8)

为什么选择这个模型

  • 开源中最大规模(2.8T)与超长上下文体验
  • 长程 Agent 与代码库级推理能力
  • 蒸馏版让超长上下文在消费级机器也能尝试
  • 月之暗面持续投入,社区关注度高

模型优点

  • 256K~1M 超长上下文
  • 长程 Agent 与工具链强
  • K3 原生多模态
  • K2 中文评测优秀
  • 蒸馏版本地门槛低

模型缺点

  • 旗舰 1T/2.8T 需集群,个人不可行
  • 许可为自定义(非 OSI)
  • 蒸馏版能力与旗舰差距大
  • 超长上下文推理 token 消耗高

适合场景

  • 整篇论文 / 代码库分析
  • 长程 Agent 工作流
  • 研究与学术助手
  • 超长日志与文档摘要
  • API 集成长文档场景

不适合场景

  • 消费级单卡跑旗舰 K2/K3
  • 对延迟敏感的低成本任务
  • 严格 OSI 合规项目
  • 移动端

部署教程

Ollama
蒸馏版:从 HF 下载 GGUF 后 ollama create 自定义模型;旗舰版建议走官方 API
LM Studio
LM Studio 支持加载 Kimi-K2 蒸馏 GGUF(需自行转换 32K 上下文)
llama.cpp
蒸馏版:llama-cli -m kimi-k2-distill-7b-q4_k_m.gguf -c 32768 -p 提示词
vLLM
旗舰版:pip install vllm && vllm serve moonshotai/Kimi-K2-Instruct-AWQ(需多卡)

智算工坊实验室

实测速度蒸馏 7B Q4 ≈35-40 token/s(RTX 3060);旗舰无消费级数据
显存占用蒸馏 7B Q4 约6GB
功耗RTX 3060 满载约170W
不同 GPU 对比超长上下文(≥32K)下 prompt 预处理显著增加,显存占用随上下文线性上升,需预留更大 KV Cache

常见问题 FAQ

Kimi 本地部署现实吗?

旗舰 K2/K3 需要 A100/H100 集群;推荐本地跑蒸馏 7B/32B 体验,或直接用月之暗面 API 享受完整超长上下文。

K2 与 K3 我该关注哪个?

K3 更新(2.8T、1M、原生视觉),能力更强但更吃算力;K2 已是成熟开源旗舰,蒸馏版也更完善。

相关模型

相关工具

相关硬件

相关文章

数据来源

  • https://huggingface.co/moonshotai/Kimi-K2-Instruct-0905
  • https://huggingface.co/moonshotai/Kimi-K3
  • https://platform.moonshot.cn/docs/pricing/chat
  • https://www.kimi.com/