Qwen3 本地部署完整教程

Qwen(通义千问)是国产开源模型里生态最完整、中文能力最强的一个系列。本教程带你把 Qwen3 从「下载」到「本地跑通」,覆盖 Ollama、llama.cpp、LM Studio 三条主流路线,并附常见问题排查。

一、准备工作:确认你的硬件

模型规模 量化 显存需求 推荐显卡
Qwen3 0.6B Q4 约 1GB 任意 4GB 显卡 / 纯 CPU
Qwen3 4B Q4 约 3GB RTX 3060 12G 起步
Qwen3 8B Q4 约 6GB RTX 3060 12G
Qwen3 14B Q4 约 10GB RTX 4080 / 4090
Qwen3 30B-A3B(MoE) Q4 约 18GB RTX 4090 24G
Qwen3 32B Q4 约 20GB RTX 4090 / 双卡
Qwen3 72B Q4 约 45GB 双卡 / 服务器
> 没有独显也能跑:Qwen3 0.6B~4B 用 CPU 推理,速度较慢但可用。

二、路线一:Ollama 一键运行(推荐新手)

Ollama 是本地运行 Qwen 最省事的方式,一条命令即可:

1
# 安装 Ollama(macOS)brew install ollama# 或 Linux:curl -fsSL https://ollama.com/install.sh | sh# 运行 Qwen3 8B(首次会自动下载)ollama run qwen3:8b

想跑其他尺寸,直接换标签名:

1
ollama run qwen3:0.6b # 轻量,纯 CPU 也能玩ollama run qwen3:4bollama run qwen3:14bollama run qwen3:32b

Ollama 会自动选择合适的量化与显存策略。运行中想退出按 Ctrl+D,查看已装模型用 ollama list。

三、路线二:llama.cpp + GGUF(跨平台最稳)

如果你用 Windows / Linux 且想精细控制量化,llama.cpp 更合适:

1
# 克隆并编译git clone https://github.com/ggml-org/llama.cppcd llama.cppcmake -B build && cmake --build build --config Release# 下载 Qwen3 8B 的 GGUF 权重(HuggingFace 上有大量社区量化)# 例如:Qwen/Qwen3-8B-GGUF 的 q4_k_m.gguf# 运行(指定 gpu 层数,越高越吃显存)./build/bin/llama-cli -m qwen3-8b-q4_k_m.gguf -ngl 99

-ngl 99 表示把 99 层都放到 GPU;显存不足时调小(如 -ngl 40)把部分层放 CPU,速度会下降但能跑起来。

四、路线三:LM Studio(图形化,适合 macOS)

LM Studio 提供图形界面:搜索 Qwen3 → 选择一个 GGUF 版本 → 下载 → 加载。适合不熟悉命令行的朋友,右侧还能调整上下文长度与 GPU offload 比例。

五、HTTP API 接入应用

无论哪条路线,都能拿到 OpenAI 兼容接口。以 Ollama 为例:

1
curl http://localhost:11434/v1/chat/completions \ -H "Content-Type: application/json" \ -d '{"model":"qwen3:8b","messages":[{"role":"user","content":"用中文介绍你有哪些能力"}]}'

Python 侧改一行 base_url 即可接入现有代码:

1
from openai import OpenAIclient = OpenAI(base_url="http://localhost:11434/v1", api_key="ollama")resp = client.chat.completions.create(model="qwen3:8b", messages=[{"role": "user", "content": "你好"}])print(resp.choices[0].message.content)

六、Qwen3 的混合推理模式

Qwen3 支持「思考 / 非思考」切换,复杂数学题先思考再答,日常闲聊直接作答:

1
# Ollama 中进入开启思考模式ollama run qwen3:8b>>> /set no_think # 关闭思考(更快)>>> /set think # 开启思考(更严谨)

七、常见问题排查

**Q:显存不够 / 卡顿怎么办?**换更小的量化(Q4→Q3)或更小的模型(8B→4B),调低 -ngl,或关闭思考模式。

**Q:Ollama 下载太慢?**国内可配置镜像源或使用 OLLAMA_MODELS 缓存目录,也可以先用脚本预下载 GGUF。

**Q:中文效果如何?**Qwen3 是中文最强开源模型之一,直接用中文提问即可,无需英文 prompt。

小结

Qwen3 全家桶从 0.6B 到 72B,总有一个尺寸适配你的显卡。新手选 Ollama、进阶用 llama.cpp、图形化选 LM Studio,三步即可把通义千问「搬回」本机,数据不出设备、离线可用。

延伸阅读: