DeepSeek 系列

★★★★★ 4.9 分

以 R1 系列引爆全球的国产推理模型,MIT 协议、数学与代码能力顶级,本地部署资料丰富,7B 蒸馏版在笔记本上即可体验「慢思考」。

中文推理MoE开源
参数量1.5B / 7B / 8B / 14B / 32B / 70B / V3 671B(MoE)
模型类型对话 + 推理大语言模型(R1 引入强化学习思维链)
许可证MIT(R1)
开发者深度求索(DeepSeek)
★★★★★ 5

以极致性价比引爆全球的开源推理王牌

中文推理代码MoE开源

模型介绍

DeepSeek(深度求索)以一己之力重塑了开源大模型格局:2024 年底的 DeepSeek-V3 以远低于国际同行的成本训练出媲美 GPT-4 级性能的 671B MoE,2025 年初的 R1 更是开源推理模型的分水岭,全球下载与 API 价格战由此开启。其体系覆盖旗舰 V3/V4 与 MIT 协议的 R1 推理系列,同时提供 1.5B~70B 的蒸馏版本,让 6GB 显存的个人电脑也能体验世界级推理。2026 年的 DeepSeek-V4 进一步把上下文推到 1M,保持纯文本高密度推理路线。

模型基本信息

开发机构深度求索(DeepSeek)
模型版本DeepSeek-V4 系列(2026)/ R1 / V3
参数规模V3 671B-A37B MoE;R1 671B-A37B(推理);蒸馏版 1.5B/7B/8B/14B/32B/70B;V4 系列 284B/1.6T MoE
模型类型文本对话 / 推理大模型
许可证MIT(R1/V3.1/V4)
上下文长度1M(V4 系列);128K(V3/R1)
发布日期2024-12-25(V3);2025-01-20(R1);2025-08-21(V3.1);2026-07-31(V4-Flash)
模型架构Transformer + MoE + MLA(多头潜在注意力)+ 稀疏注意力(DeepseekV3ForCausalLM / DeepseekV4ForCausalLM)

模型能力

中文能力很强
英文能力很强
代码能力很强
推理能力很强(R1 为代表)
长文本能力很强(1M / V4)
视觉能力弱(纯文本,另有 Janus 多模态)
工具调用强

模型版本

DeepSeek-V4-Flash284B MoE 轻量化 V4DeepSeek-R1671B-A37B MoE(推理旗舰,MIT)DeepSeek-V3.1671B-A37B MoEDeepSeek-V3671B-A37B MoER1-Distill-Qwen-32B32B 蒸馏(Qwen 基座)R1-Distill-Qwen-7B7B 蒸馏(轻量首选)

模型获取

部署方式

OllamaLM Studiollama.cppvLLMSGLangtransformers

显存需求

R1-Distill-7B Q4约6GB
R1-Distill-14B Q4约10GB
R1-Distill-32B Q4约20GB
V3/R1 671B(FP8)集群约700GB

硬件推荐

RTX 3060R1 蒸馏 1.5B~7B Q4
RTX 3090蒸馏 14B~32B Q4
RTX 4090蒸馏 32B~70B(Q4 多卡/优化)
RTX 5090蒸馏 70B Q4 约40GB
MacM4 Ultra 可跑蒸馏 32B Q4

推荐配置

入门RTX 3060 12G + R1-Distill-7B Q4 约6GB
进阶RTX 4090 24G + R1-Distill-32B Q4 约20GB
专业A100/H100 ×4~8 + V3/R1/V4 671B 集群(FP8)

为什么选择这个模型

  • MIT 协议最宽松,可自由商用
  • R1 开源以来推理与数学能力的标杆
  • V4 系列把 1M 上下文带给开源社区
  • 蒸馏版让消费级设备用上顶级推理能力

模型优点

  • 推理/数学/代码表现顶级
  • 训练推理成本极低
  • MIT 可商用且无限制
  • 1M 超长上下文
  • API 价格亲民,社区资料海量

模型缺点

  • 671B 旗舰需要多卡集群,本地几乎不可行
  • 纯文本不直接支持图像输入
  • 推理模式 token 消耗较多
  • R1/V3 官方权重体积庞大

适合场景

  • 数学 / 逻辑 / 复杂推理
  • 代码生成与 Agent 工具链
  • 1M 超长文档分析
  • API 集成做国产替代
  • 研究知识蒸馏

不适合场景

  • 普通闲聊(成本高、杀鸡用牛刀)
  • 单卡想跑 V3/R1 旗舰
  • 需要视觉理解的场景(无图像输入)
  • 对推理延迟极度敏感的应用

部署教程

Ollama
ollama run deepseek-r1:8b(适合本地);671B 旗舰用 deepseek-r1:671b 需集群
LM Studio
LM Studio 下载 R1-Distill 系列 GGUF → 加载 → 开启 'Thinking mode' 观察推理链
llama.cpp
./llama-cli -m r1-distill-qwen-7b-q4_k_m.gguf -p 问题 -ngl 999
vLLM
pip install vllm && vllm serve deepseek-ai/DeepSeek-R1-Distill-Qwen-32B

智算工坊实验室

实测速度R1-Distill-7B Q4 实测 ≈35-40 token/s(RTX 3060)
显存占用蒸馏 7B Q4 约6GB;蒸馏 32B Q4 约20GB
功耗RTX 3060 满载约170W;RTX 4090 约450W
不同 GPU 对比推理模式比普通模式慢约 2-3 倍(多 generation token);RTX 4090 相比 3060 提速约 2 倍
→ 查看实验室数据

常见问题 FAQ

本地部署应该选哪个版本?

个人单卡推荐 R1-Distill-7B/14B/32B(Qwen 蒸馏版),旗舰 V3/R1 671B 需 4 卡以上企业级硬件,建议直接用官方 API。

R1 和 V3 有什么区别?

R1 是专门强化推理过程的版本,回答前先生成思考链,数学/逻辑更强但更慢更耗 token;V3 是通用对话基线,响应更快。

相关模型

相关工具

相关硬件

相关文章

数据来源

  • https://huggingface.co/deepseek-ai/DeepSeek-R1
  • https://huggingface.co/deepseek-ai/DeepSeek-V3
  • https://huggingface.co/deepseek-ai/DeepSeek-R1-Distill-Qwen-7B
  • https://www.deepseek.com/