Phi 系列(微软)

★★★★★ 4.6 分

微软的「小而强」小语言模型,用高质量合成数据训练,3.8B 在手机级显存达到大模型级推理能力。

英文轻量小模型微软
参数量Phi-3.5-mini(3.8B)/ Phi-4(14B)
模型类型小规模高质量语言模型(SLM)
许可证MIT
开发者Microsoft Research
★★★★★ 4.5

微软「小而强」,小模型逆袭大模型能力

英文代码数学开源小模型

模型介绍

Phi 是微软研究院的「小而强」小语言模型系列,用高质量网页/书籍/合成数据训练,验证了「尺寸小也能强」的路线:2024 年的 Phi-4(14B)在数学与编程基准上对标多倍参数模型,2025 年的 Phi-4-mini(3.8B)则可跑在手机级设备。2026 年起微软将该系列定位转向浏览器 Agent(如基于 Qwen3.5 的 Fara1.5 27B),Phi 主线作为轻量快速基线依然广泛适用。对低显存、低延迟、高吞吐场景,Phi 是极具性价比的选择。

模型基本信息

开发机构Microsoft Research
模型版本Phi-4 / Phi-4-mini
参数规模Phi-3-mini 3.8B;Phi-4 14B;Phi-4-mini 3.8B;Phi-3.5-MoE 16x3.8B
模型类型文本对话 / 推理 / 代码
许可证MIT
上下文长度128K(Phi-4-mini / Phi-3.5 支持);16K(Phi-4 14B)
发布日期2024-12-11(Phi-4);2025-02-19(Phi-4-mini)
模型架构Decoder-only Transformer + Sliding Window Attention + GQA(Microsoft 自研 tokenizer);14B 为稠密

模型能力

中文能力中(弱于国产)
英文能力很强
代码能力很强
推理能力很强(数学/STEM)
长文本能力中(16K~128K)
视觉能力弱(另有 visual 变体)
工具调用中

模型版本

Phi-414BPhi-4-mini-instruct3.8BPhi-3.5-MoE16x3.8B MoEPhi-3.5-mini-instruct3.8BPhi-3-small-128k7B

模型获取

部署方式

OllamaLM Studiollama.cppvLLMtransformersONNX Runtime

显存需求

Phi-3.5-mini 3.8B Q4约3GB
Phi-4-mini 3.8B Q4约3GB
Phi-4 14B Q4约9GB

硬件推荐

RTX 3060Phi-4 14B(Q4)
RTX 3090Phi-4 FP16 舒适
RTX 4090并发吞吐优势明显
RTX 5090小模型高并发/低延迟场景
MacApple Silicon 3.8B~14B 流畅

推荐配置

入门RTX 3060 12G + Phi-4 14B Q4 约9GB
进阶RTX 3090/4090 24G + Phi-4 FP16 或 Phi-3.5-MoE
专业GPU 服务器做高并发小模型服务(14B 吞吐可观)

为什么选择这个模型

  • 小尺寸实现大模型级数学/代码能力
  • 3.8B 手机/CPU 可跑
  • MIT 完全可商用
  • 低延迟高吞吐非常适合生产服务

模型优点

  • 数学/编程/STEM 强
  • 3.8B 极低门槛
  • MIT 可商用
  • Azure 生态整合
  • 低延迟适合边缘

模型缺点

  • 世界知识有限、易幻觉
  • 中文明显弱
  • 开放域闲聊表现一般
  • 长上下文能力有限
  • 多模态需变体

适合场景

  • 数学推理/逻辑问答
  • 结构化数据处理
  • 端侧与嵌入式
  • 低成本高并发 API 服务
  • 代码片段生成

不适合场景

  • 中文长文创作
  • 开放域知识问答
  • 多模态任务
  • 鲁棒性敏感的生产环境(幻觉)

部署教程

Ollama
ollama run phi4:14b(或 phi3.5:3.8b 轻量)
LM Studio
LM Studio 搜索 microsoft/phi-4 下载 GGUF → 加载 → 使用
llama.cpp
./llama-cli -m phi-4-q4_k_m.gguf -p 提示词 -ngl 999
vLLM
pip install vllm && vllm serve microsoft/Phi-4

智算工坊实验室

实测速度Phi-4 14B Q4 实测 ≈30-35 token/s(RTX 3060);3.8B ≈50+ token/s
显存占用14B Q4 约9GB;3.8B Q4 约3GB
功耗RTX 3060 满载约170W
不同 GPU 对比3.8B 在核显也能跑;14B 在 12GB 卡顺畅,3090/4090 几乎满速

常见问题 FAQ

Phi 适合什么场景?

数学、逻辑、代码、结构化问答等能力密集型轻任务最合适;不要拿来做中文创作或开放域闲聊。

Phi-4 与 Phi-3.5 怎么选?

Phi-4(14B)能力更强但更重;Phi-3.5-mini/MoE 更轻、128K 上下文,端侧与低配卡首选。

相关模型

相关工具

相关硬件

相关文章

数据来源

  • https://huggingface.co/microsoft/Phi-4
  • https://huggingface.co/microsoft/phi-4-mini-instruct
  • https://azure.microsoft.com/en-us/blog/introducing-phi-4-microsofts-newest-small-language-model/
  • https://ollama.com/library/phi4