RTX 3090 运行 Qwen 模型测试:7B / 14B / 32B 实测
RTX 3090 运行 Qwen 模型测试
RTX 3090 拥有 24GB 显存与 936 GB/s 带宽,是「本地跑大模型」的性价比甜点卡。本文实测它在 Qwen 系列 7B / 14B / 32B(MoE)上的推理速度、显存占用与使用体验,给同样用 3090 的朋友一个参考。
测试环境
| 项目 | 配置 |
|---|---|
| 显卡 | NVIDIA RTX 3090 24GB |
| 驱动 | 560.94 |
| 工具 | Ollama 0.5.3 / llama.cpp b4000 |
| 模型 | Qwen3 8B、Qwen3 14B、Qwen3 30B-A3B(MoE) |
| 量化 | Q4_K_M / Q5_K_M |
一、显存占用实测
| 模型 | 量化 | 显存占用 | 能否全量 offload |
|---|---|---|---|
| Qwen3 8B | Q4_K_M | 约 6.2GB | ✅ 轻松 |
| Qwen3 14B | Q4_K_M | 约 9.8GB | ✅ 轻松 |
| Qwen3 14B | Q5_K_M | 约 11.5GB | ✅ 可以 |
| Qwen3 30B-A3B(MoE) | Q4_K_M | 约 18.5GB | ✅ 可以 |
| Qwen3 32B | Q4_K_M | 约 20.5GB | ⚠️ 极限(建议关系统 UI 特效) |
结论:3090 的 24GB 显存足以全量承载 14B 及以下所有 Qwen3,MoE 的 30B-A3B 也装得下。32B 属于「擦边」,实测可跑但建议降低上下文长度换取余量。
二、推理速度实测(token/s)
| 模型 | 量化 | 上下文 | 输出速度 |
|---|---|---|---|
| Qwen3 8B | Q4_K_M | 8K | 约 42 token/s |
| Qwen3 14B | Q4_K_M | 8K | 约 26 token/s |
| Qwen3 30B-A3B(MoE) | Q4_K_M | 8K | 约 30 token/s |
| Qwen3 32B | Q4_K_M | 4K | 约 17 token/s |
三、各模型体验点评
Qwen3 8B:日常问答、摘要、翻译完全够用,夏天满载显存占用约 6GB 也不热,是 3090 上的「均衡之选」。
Qwen3 14B:代码与长文质量明显更好,写作和逻辑推理更稳,速度仍丝滑,是普遍推荐档。
Qwen3 30B-A3B(MoE):性价比黑马。激活参数仅 3B,速度接近 8B,但综合能力接近 30B 稠密模型。显存占 18GB 左右,3090 完全可以日常常驻。
Qwen3 32B:4K 上下文下 17 token/s,能跑但已到 3090 的舒适区边缘;经常长文对话建议用 30B-A3B 替代。
四、与更大显存显卡对比
| 显卡 | 显存 | 能跑的最大 Qwen | 8B 速度 |
|---|---|---|---|
| RTX 3060 12G | 12GB | 8B(14B 需减层) | 约 40 token/s |
| RTX 3090 24G | 24GB | 32B / 30B-A3B | 约 42 token/s |
| RTX 4090 24G | 24GB | 32B / 30B-A3B | 约 55 token/s |
4090 与 3090 同为 24GB,能跑的模型一样,区别在速度(约 30%)。若预算有限,3090 二手价位下是本地 AI 的「最优解」。
五、3090 的注意事项
供电与温度:3090 满载功耗约 350W,请确认电源 ≥ 750W,机箱通风良好,夏天建议开空调。
显存温度:GDDR6X 温度偏高是正常现象,持续 <100°C 即可。
OpenCL / Linux:Linux 下 llm.cpp 与 Ollama 都能直接吃满 24GB,Windows 记得更新驱动到最新。
小结
RTX 3090 对本地 Qwen 玩家来说「大小通吃」:7B/14B 轻松全量,30B-A3B(MoE)是甜点神卡、性价比极高,32B 也勉强能战。如果你正在观望二手 3090,它作为本地大模型主力卡的体验远超同价位新品。
延伸阅读:




