Apple Silicon 跑本地大模型:M1 到 M4 的完整指南

Mac 没有 NVIDIA 显卡,但 Apple Silicon 的统一内存架构让它跑大模型有独特优势:模型直接用内存跑,不用抠显存,还能低功耗待机。这篇文章覆盖 M1 到 M4 全系,讲清怎么选 Mac、用什么工具、各档机型能跑多大模型。

MacBook Pro

一、Apple Silicon 跑大模型的底层逻辑

为什么 Mac 能跑大模型?关键在于统一内存(Unified Memory)。传统 PC 有独立的显存和内存,两者之间传数据是性能瓶颈;Apple Silicon 的 CPU、GPU 共享同一块内存,模型可以直接放在内存里跑,GPU 直接读——省去了数据搬运。

这带来两个直接结果:

  • 显存=内存:你买 64GB 的 MacBook Pro,跑模型就能用到 64GB「显存」,这比任何消费级显卡都大;

  • 门槛低:8GB 内存的入门 Mac 也能跑 7B 模型,而 NVIDIA 8GB 显卡已经被 14B 卡脖子。

代价也明显:内存带宽远低于显卡。NVIDIA 4090 带宽约 1TB/s,M3 Max 只有 400GB/s 左右。所以 Mac 跑模型不是「最强」,而是「大模型能跑 + 省电 + 静音」。

统一内存的边界在哪里

统一内存并非没有代价,理解它的边界才能用对:

  • 内存带宽决定速度上限:模型要「喂」给 GPU 计算,每生成一个 token 都要把权重从内存读一遍,读得快慢由带宽决定。这就是为什么 Mac 上「模型越大、token/s 越低」比显卡更明显——同一带宽下参数多了,单位时间能算的 token 自然少了;

  • 系统内存要留余量:macOS 本身、浏览器、其他应用也吃内存。跑模型至少要留 4~6GB 给系统,否则触发 swap(内存交换到 SSD),速度直接崩掉;

  • 「内存即显存」不等于无限:64GB 内存看起来很大,但 70B 模型 Q4 要 41GB、加上 KV Cache 和系统余量,64GB 内存跑 70B 其实很紧张。买内存时把「模型 + 系统余量 + 未来升级空间」一起算。

理解了这三条,你就知道 Mac 跑大模型的正确姿势:内存买够、带宽要 Pro/Max、别和系统抢内存。

二、工具选型:这些都能在 Mac 上用

工具 特点 推荐
Ollama 最省事,一条命令跑 首推
llama.cpp(Apple Metal 版) 性能最好,可精细调参 进阶
LM Studio 图形界面,适合新手 备选
MLX(Apple 官方) 专为 Apple Silicon 优化 技术党
vLLM(MLX 后端) 并发推理 服务化场景

Ollama 在 Mac 上默认就走 Metal(Apple GPU),无需任何配置。想手动指定设备:

1
OLLAMA_KEEP_ALIVE=1m ollama run qwen3:8b

llama.cpp 的 Mac 版编译时带 Metal:

1
git clone https://github.com/ggml-org/llama.cppcd llama.cpp && cmake -B build -DGGML_METAL=ON && cmake --build build --config Release./build/bin/llama-cli -m model.gguf -ngl 99

-ngl 99 表示全部层放 GPU(Apple Silicon 上即 Metal 加速)。

MLX:Apple 自家框架值得一试

Ollama 和 llama.cpp 是把模型跑起来的最快路径,但如果你愿意折腾一点,MLX(Apple 官方机器学习框架)值得单独提一档。它的优势:

  • 为 Apple Silicon 深度优化:MLX 由 Apple 团队维护,针对 M 系列 GPU 的 Metal 优化很彻底,部分模型上比 llama.cpp 的 Metal 版还快;

  • 内存高效:MLX 支持 lazy 加载和统一内存的高效利用,大模型在 Mac 上的运行更省内存;

  • 生态适配广:HuggingFace 上大量模型有 MLX 版,mlx-lm 一行命令即可跑:

1
pip install mlx-lmpython -m mlx_lm.generate --model Qwen/Qwen3-8B-MLX --prompt "你好"

MLX 适合已经熟练 Ollama、想要榨干 M 系列性能的技术玩家。新手先 Ollama,跑顺了再玩 MLX 不迟。

三、M 系列芯片能跑多大模型

Apple Silicon 的内存(等于「显存」)是唯一硬约束。以 Q4_K_M 量化、8K 上下文估算:

机型 内存 能跑的最大模型 推荐档
M1/M2 基础版 8GB 7B 勉强 4B 舒适
M1/M2 中配 16GB 14B 8B
M1 Pro/Max、M2 Pro 16~32GB 14B~32B 8B~14B
M2 Max / M3 Max 32~96GB 32B~70B 14B~32B
M3/M4 Pro 18~48GB 14B~32B 8B~14B
> 提示:跑模型至少要留 2~4GB 内存给系统。32GB 内存跑 70B Q4(约 41GB)会超出,别被「型号很大」骗了——看内存,不看型号。

内存换算的实用速查

目标模型(Q4_K_M) 建议最低内存 舒适内存 理由
4B 8GB 16GB 模型约 2.5GB + 系统余量
8B 16GB 24GB 模型约 5GB + 上下文 + 系统
14B 24GB 32GB 模型约 8GB + KV + 系统
32B 32GB 48GB+ 模型约 18GB + KV + 系统
70B 48GB 64GB+ 模型约 41GB,很紧张

建议遵循「舒适内存」那列——差 8GB 内存的预算差异不大,但体验差异是「偶尔卡」和「一直流畅」的区别。Mac 内存不能后续加装,买小了只能换机,这点和可扩展的 PC 不同。

四、实测速度:各档机型的 token/s

用 Qwen3 8B Q4_K_M、8K 上下文实测输出速度:

机型 内存 速度(token/s) 评价
M1 8GB 约 14 能用,较慢
M2 16GB 约 20 可接受
M1 Pro 16GB 约 22 日常够用
M2 Pro 32GB 约 28 流畅
M3 Pro 36GB 约 30 流畅
M3 Max 64GB 约 45 快
M4 Pro 48GB 约 50 快
> 提示:速度上限主要由内存带宽决定,带宽随 Max 系列明显提升。所以「M 系列数字大 ≠ 快」,Pro/Max 的核心区别之一就是带宽。基础版 M1 跑 8B 只有 14 token/s,体验一般,加预算上 Pro/Max 感知很强。

MacBook 运行

影响速度的几个「隐形因素」

实测数据之外,还有几个变量会在实际使用中改变速度,排查「为什么我的 Mac 比表里慢」时按顺序查:

  • 是否插电:不插电时 macOS 会主动限制性能(节能策略),跑模型的 token/s 可能掉 30~50%。跑大模型务必插电,这是最容易被忽略的一项;

  • 后台占用:浏览器开一堆标签、还有剪辑软件在渲染,内存带宽被占用,推理自然变慢。跑重模型前先清后台;

  • 模型是否真的走了 Metal:Ollama 日志会显示 gpu 还是 cpu。如果显示 CPU 推理,检查是否装了带 Metal 的版本、或手动把 OLLAMA_LLM_LIBRARY=metal 指定;

  • 电量与发热:长时间满载跑模型,芯片可能降频,速度会从峰值回落——这是正常现象,不是坏了。

五、大模型之外的 Mac 玩法

Mac 跑大模型还有一个隐藏优势:跑图像/视频/语音模型同样方便。

  • Stable Diffusion / Flux:ComfyUI 有官方 Mac 版,M 系列 GPU 出图质量正常,速度低于 NVIDIA 但完全可用(512px 约 10~20 秒);

  • Whisper 语音转写:faster-whisper 在 M 系列上约 4 倍于 CPU 速度(见本站转写文章实测);

  • MLX 生态:Apple 官方 MLX 框架适配了大量模型,M 系列上常比 llama.cpp 还快,技术党值得一试。

本地 AI 全家桶的完整工作流

Mac 用户完全可以搭一套「全本地 AI 工作流」,各环节都有成熟的 Apple Silicon 方案:

需求 方案 机型建议
文本对话 Ollama + Qwen3 16GB+
写代码 Continue + Qwen3-Coder 16GB+
出图 ComfyUI + SDXL/Flux 24GB+
转文字 faster-whisper 8GB 即可
知识库 AnythingLLM + Ollama 16GB+
视频 ComfyUI + Wan 32GB+

这套组合的奇妙之处在于:全部离线、全部免费、一台 Mac 搞定。出差时笔记本就是你的 AI 工作站,不需要任何云端 API。这也让「Mac 跑 AI」从「尝鲜」变成了「生产力工具」——前提是内存选够。

六、选购与实用建议

选内存:跑大模型的核心是内存。能上 24GB/32GB 就上,别在存储上省钱——模型文件(7B 约 5GB,32B 约 18GB)也要占磁盘。

选型号:预算允许优先 Pro/Max,带宽差异直接影响跑模型体验。

日常设置:

  • 跑模型时插电:独显/GPU 负载下 Mac 电池会掉得快;

  • 用完 ollama stop 释放内存,或设 OLLAMA_KEEP_ALIVE;

  • 外接显示器跑大模型影响不大,别担心;

  • 环境散热:M 系列跑模型风扇基本不响,长时间跑建议垫高。

踩过的坑:

  • 8GB 内存跑 14B 会疯狂 swap(内存交换到 SSD),速度惨不忍睹,别试;

  • 装模型前看官网是否提供 Mac 专用版(部分模型只发了 CUDA 版);

  • Python 环境冲突:Mac 用户注意用 venv 或 conda 隔离环境,别污染系统 Python。

Mac 上的模型文件管理

模型文件体积不小(7B 约 5GB,32B 约 18GB),Mac 用户还要注意:

  • 存哪:Ollama 默认存在 ~/.ollama/models/,/ 盘空间不够就改 OLLAMA_MODELS 指向外置 SSD——外置雷电硬盘的读取速度足够跑模型,不用装进系统盘;

  • 磁盘清理:ollama list 看看装了哪些,不用的 ollama rm 删掉。Mac 系统盘空间紧张很常见,别让模型占满;

  • 内存 vs 磁盘:模型文件在磁盘上,加载时进内存。磁盘满≠内存满,但磁盘满会导致 swap 空间不足,间接拖累性能——两个都别忽视。

长时间跑模型的散热与续航

M 系列跑模型比 PC 安静得多,但长时间满载仍要注意:

  • 垫高通风:MacBook 垫起来底部通风好,长时间跑模型更稳,M 系列几乎听不到风扇声是常态,但别贴着被子跑;

  • 插电运行:跑模型功耗高,电池模式会降频且掉电快,跑重的任务插电;

  • 合盖跑:想外接显示器、合盖跑,确认「合盖不休眠」设置,否则一合盖就暂停。

七、Mac vs NVIDIA 怎么选

对比项 Apple Silicon NVIDIA 显卡
可用的模型规模 内存够就能跑大模型 受显存限制
速度 中(带宽限制) 快(尤其预填充)
功耗/噪音 低、安静 高、需风扇
场景 个人使用、办公、移动 追求性能、服务化
成本 一次买断 显卡+电源+机箱

一句话:想在桌面上长期跑 70B 大模型还不吵,Mac 是最优解;追求 token/s 和并发吞吐,NVIDIA 胜。大多数人日常问答、写代码、转文字,Mac 完全够用还省心。

什么情况果断选 Mac,什么情况别选

适合 Mac 的人群:已经用 Mac 办公、需要移动使用 AI、在意静音和功耗、跑 14B~32B 这个体量的模型、或想要「内存大就能跑更大模型」的灵活性。

别选 Mac 的人群:追求极致 token/s、跑并发服务、要批量出图出视频(GPU 算力吃紧)、或手头已有 NVIDIA 显卡——没必要为了跑模型再添一台 Mac。工具各有所长,按需选型最重要。

综合建议

你的情况 推荐
已有 Mac、想跑 AI 直接 Ollama,够用
准备买 Mac 且要跑模型 内存 24GB+,选 Pro 芯片
已有 NVIDIA 卡 用它跑,别重复投资
追求最大模型 + 安静 Mac Max/Ultra 大内存
追求最快 + 并发 NVIDIA 平台

小结

Apple Silicon 用「内存即显存」的架构,把本地跑大模型的门槛从「买高端显卡」降到了「选台内存够大的 Mac」。选机先看内存(8GB 玩 4B,16GB 玩 8B,32GB 上 32B),速度看带宽(Pro/Max 更好)。Ollama 一条命令即可开始,工具链成熟,是 Mac 用户本地 AI 的确定路径。

用一句话总结本文的取舍:Mac 的本地 AI 定位不是「最快」,而是「能跑大模型 + 安静省电 + 移动便携」的组合优势。配一台 24~32GB 内存的 Pro/Max 机型,覆盖日常问答、写代码、转文字、跑 RAG 知识库完全够用;真要卷速度、卷并发,那才是 NVIDIA 的主场。先把内存这个唯一硬约束选对,剩下的交给 Ollama,你的 Mac 就能立刻变成一个安静的本地 AI 工作站。无论是日常问答、写代码还是跑知识库,这套「零云端」方案都能让你摆脱 API 依赖,专注在手上的活上。等哪天你想压榨更多性能,再切换到 MLX 或 llama.cpp,升级路径也是现成的,从入门到进阶完全平滑,不会被某一步卡住。最后留一句忠告:Mac 本地 AI 的坑大多出在内存和带宽上,本文的两张表和四条隐形因素,基本就是全部答案。按这套思路选机、配置、排障,你就能把 Mac 从「轻薄本」用成真正安静又省心的本地 AI 工作站,长跑 70B 也不吵不热,白天干活、晚上待机,完全不用操心。

延伸阅读: