Qwen3 本地部署完整教程:从下载到跑通全流程
Qwen3 本地部署完整教程
Qwen(通义千问)是国产开源模型里生态最完整、中文能力最强的一个系列。本教程带你把 Qwen3 从「下载」到「本地跑通」,覆盖 Ollama、llama.cpp、LM Studio 三条主流路线,并附常见问题排查。
一、准备工作:确认你的硬件
| 模型规模 | 量化 | 显存需求 | 推荐显卡 |
|---|---|---|---|
| Qwen3 0.6B | Q4 | 约 1GB | 任意 4GB 显卡 / 纯 CPU |
| Qwen3 4B | Q4 | 约 3GB | RTX 3060 12G 起步 |
| Qwen3 8B | Q4 | 约 6GB | RTX 3060 12G |
| Qwen3 14B | Q4 | 约 10GB | RTX 4080 / 4090 |
| Qwen3 30B-A3B(MoE) | Q4 | 约 18GB | RTX 4090 24G |
| Qwen3 32B | Q4 | 约 20GB | RTX 4090 / 双卡 |
| Qwen3 72B | Q4 | 约 45GB | 双卡 / 服务器 |
二、路线一:Ollama 一键运行(推荐新手)
Ollama 是本地运行 Qwen 最省事的方式,一条命令即可:
1 | # 安装 Ollama(macOS)brew install ollama# 或 Linux:curl -fsSL https://ollama.com/install.sh | sh# 运行 Qwen3 8B(首次会自动下载)ollama run qwen3:8b |
想跑其他尺寸,直接换标签名:
1 | ollama run qwen3:0.6b # 轻量,纯 CPU 也能玩ollama run qwen3:4bollama run qwen3:14bollama run qwen3:32b |
Ollama 会自动选择合适的量化与显存策略。运行中想退出按 Ctrl+D,查看已装模型用 ollama list。
三、路线二:llama.cpp + GGUF(跨平台最稳)
如果你用 Windows / Linux 且想精细控制量化,llama.cpp 更合适:
1 | # 克隆并编译git clone https://github.com/ggml-org/llama.cppcd llama.cppcmake -B build && cmake --build build --config Release# 下载 Qwen3 8B 的 GGUF 权重(HuggingFace 上有大量社区量化)# 例如:Qwen/Qwen3-8B-GGUF 的 q4_k_m.gguf# 运行(指定 gpu 层数,越高越吃显存)./build/bin/llama-cli -m qwen3-8b-q4_k_m.gguf -ngl 99 |
-ngl 99 表示把 99 层都放到 GPU;显存不足时调小(如 -ngl 40)把部分层放 CPU,速度会下降但能跑起来。
四、路线三:LM Studio(图形化,适合 macOS)
LM Studio 提供图形界面:搜索 Qwen3 → 选择一个 GGUF 版本 → 下载 → 加载。适合不熟悉命令行的朋友,右侧还能调整上下文长度与 GPU offload 比例。
五、HTTP API 接入应用
无论哪条路线,都能拿到 OpenAI 兼容接口。以 Ollama 为例:
1 | curl http://localhost:11434/v1/chat/completions \ -H "Content-Type: application/json" \ -d '{"model":"qwen3:8b","messages":[{"role":"user","content":"用中文介绍你有哪些能力"}]}' |
Python 侧改一行 base_url 即可接入现有代码:
1 | from openai import OpenAIclient = OpenAI(base_url="http://localhost:11434/v1", api_key="ollama")resp = client.chat.completions.create(model="qwen3:8b", messages=[{"role": "user", "content": "你好"}])print(resp.choices[0].message.content) |
六、Qwen3 的混合推理模式
Qwen3 支持「思考 / 非思考」切换,复杂数学题先思考再答,日常闲聊直接作答:
1 | # Ollama 中进入开启思考模式ollama run qwen3:8b>>> /set no_think # 关闭思考(更快)>>> /set think # 开启思考(更严谨) |
七、常见问题排查
**Q:显存不够 / 卡顿怎么办?**换更小的量化(Q4→Q3)或更小的模型(8B→4B),调低 -ngl,或关闭思考模式。
**Q:Ollama 下载太慢?**国内可配置镜像源或使用 OLLAMA_MODELS 缓存目录,也可以先用脚本预下载 GGUF。
**Q:中文效果如何?**Qwen3 是中文最强开源模型之一,直接用中文提问即可,无需英文 prompt。
小结
Qwen3 全家桶从 0.6B 到 72B,总有一个尺寸适配你的显卡。新手选 Ollama、进阶用 llama.cpp、图形化选 LM Studio,三步即可把通义千问「搬回」本机,数据不出设备、离线可用。
延伸阅读:




