以极致性价比引爆全球的开源推理王牌
模型介绍
DeepSeek(深度求索)以一己之力重塑了开源大模型格局:2024 年底的 DeepSeek-V3 以远低于国际同行的成本训练出媲美 GPT-4 级性能的 671B MoE,2025 年初的 R1 更是开源推理模型的分水岭,全球下载与 API 价格战由此开启。其体系覆盖旗舰 V3/V4 与 MIT 协议的 R1 推理系列,同时提供 1.5B~70B 的蒸馏版本,让 6GB 显存的个人电脑也能体验世界级推理。2026 年的 DeepSeek-V4 进一步把上下文推到 1M,保持纯文本高密度推理路线。
模型基本信息
开发机构深度求索(DeepSeek)
模型版本DeepSeek-V4 系列(2026)/ R1 / V3
参数规模V3 671B-A37B MoE;R1 671B-A37B(推理);蒸馏版 1.5B/7B/8B/14B/32B/70B;V4 系列 284B/1.6T MoE
模型类型文本对话 / 推理大模型
许可证MIT(R1/V3.1/V4)
上下文长度1M(V4 系列);128K(V3/R1)
发布日期2024-12-25(V3);2025-01-20(R1);2025-08-21(V3.1);2026-07-31(V4-Flash)
模型架构Transformer + MoE + MLA(多头潜在注意力)+ 稀疏注意力(DeepseekV3ForCausalLM / DeepseekV4ForCausalLM)
模型能力
中文能力很强
英文能力很强
代码能力很强
推理能力很强(R1 为代表)
长文本能力很强(1M / V4)
视觉能力弱(纯文本,另有 Janus 多模态)
工具调用强
模型版本
DeepSeek-V4-Flash284B MoE 轻量化 V4DeepSeek-R1671B-A37B MoE(推理旗舰,MIT)DeepSeek-V3.1671B-A37B MoEDeepSeek-V3671B-A37B MoER1-Distill-Qwen-32B32B 蒸馏(Qwen 基座)R1-Distill-Qwen-7B7B 蒸馏(轻量首选)
模型获取
部署方式
OllamaLM Studiollama.cppvLLMSGLangtransformers
显存需求
R1-Distill-7B Q4约6GB
R1-Distill-14B Q4约10GB
R1-Distill-32B Q4约20GB
V3/R1 671B(FP8)集群约700GB
硬件推荐
RTX 3060R1 蒸馏 1.5B~7B Q4
RTX 3090蒸馏 14B~32B Q4
RTX 4090蒸馏 32B~70B(Q4 多卡/优化)
RTX 5090蒸馏 70B Q4 约40GB
MacM4 Ultra 可跑蒸馏 32B Q4
推荐配置
入门RTX 3060 12G + R1-Distill-7B Q4 约6GB
进阶RTX 4090 24G + R1-Distill-32B Q4 约20GB
专业A100/H100 ×4~8 + V3/R1/V4 671B 集群(FP8)
为什么选择这个模型
- MIT 协议最宽松,可自由商用
- R1 开源以来推理与数学能力的标杆
- V4 系列把 1M 上下文带给开源社区
- 蒸馏版让消费级设备用上顶级推理能力
模型优点
- 推理/数学/代码表现顶级
- 训练推理成本极低
- MIT 可商用且无限制
- 1M 超长上下文
- API 价格亲民,社区资料海量
模型缺点
- 671B 旗舰需要多卡集群,本地几乎不可行
- 纯文本不直接支持图像输入
- 推理模式 token 消耗较多
- R1/V3 官方权重体积庞大
适合场景
- 数学 / 逻辑 / 复杂推理
- 代码生成与 Agent 工具链
- 1M 超长文档分析
- API 集成做国产替代
- 研究知识蒸馏
不适合场景
- 普通闲聊(成本高、杀鸡用牛刀)
- 单卡想跑 V3/R1 旗舰
- 需要视觉理解的场景(无图像输入)
- 对推理延迟极度敏感的应用
部署教程
Ollama
ollama run deepseek-r1:8b(适合本地);671B 旗舰用 deepseek-r1:671b 需集群
LM Studio
LM Studio 下载 R1-Distill 系列 GGUF → 加载 → 开启 'Thinking mode' 观察推理链
llama.cpp
./llama-cli -m r1-distill-qwen-7b-q4_k_m.gguf -p 问题 -ngl 999
vLLM
pip install vllm && vllm serve deepseek-ai/DeepSeek-R1-Distill-Qwen-32B
智算工坊实验室
实测速度R1-Distill-7B Q4 实测 ≈35-40 token/s(RTX 3060)
显存占用蒸馏 7B Q4 约6GB;蒸馏 32B Q4 约20GB
功耗RTX 3060 满载约170W;RTX 4090 约450W
不同 GPU 对比推理模式比普通模式慢约 2-3 倍(多 generation token);RTX 4090 相比 3060 提速约 2 倍
常见问题 FAQ
本地部署应该选哪个版本?
个人单卡推荐 R1-Distill-7B/14B/32B(Qwen 蒸馏版),旗舰 V3/R1 671B 需 4 卡以上企业级硬件,建议直接用官方 API。
R1 和 V3 有什么区别?
R1 是专门强化推理过程的版本,回答前先生成思考链,数学/逻辑更强但更慢更耗 token;V3 是通用对话基线,响应更快。
相关模型
相关工具
相关硬件
相关文章
数据来源
- https://huggingface.co/deepseek-ai/DeepSeek-R1
- https://huggingface.co/deepseek-ai/DeepSeek-V3
- https://huggingface.co/deepseek-ai/DeepSeek-R1-Distill-Qwen-7B
- https://www.deepseek.com/