RTX 3090 运行 Qwen 模型测试

RTX 3090 拥有 24GB 显存与 936 GB/s 带宽,是「本地跑大模型」的性价比甜点卡。本文实测它在 Qwen 系列 7B / 14B / 32B(MoE)上的推理速度、显存占用与使用体验,给同样用 3090 的朋友一个参考。

测试环境

项目 配置
显卡 NVIDIA RTX 3090 24GB
驱动 560.94
工具 Ollama 0.5.3 / llama.cpp b4000
模型 Qwen3 8B、Qwen3 14B、Qwen3 30B-A3B(MoE)
量化 Q4_K_M / Q5_K_M

一、显存占用实测

模型 量化 显存占用 能否全量 offload
Qwen3 8B Q4_K_M 约 6.2GB ✅ 轻松
Qwen3 14B Q4_K_M 约 9.8GB ✅ 轻松
Qwen3 14B Q5_K_M 约 11.5GB ✅ 可以
Qwen3 30B-A3B(MoE) Q4_K_M 约 18.5GB ✅ 可以
Qwen3 32B Q4_K_M 约 20.5GB ⚠️ 极限(建议关系统 UI 特效)

结论:3090 的 24GB 显存足以全量承载 14B 及以下所有 Qwen3,MoE 的 30B-A3B 也装得下。32B 属于「擦边」,实测可跑但建议降低上下文长度换取余量。

二、推理速度实测(token/s)

模型 量化 上下文 输出速度
Qwen3 8B Q4_K_M 8K 约 42 token/s
Qwen3 14B Q4_K_M 8K 约 26 token/s
Qwen3 30B-A3B(MoE) Q4_K_M 8K 约 30 token/s
Qwen3 32B Q4_K_M 4K 约 17 token/s
> 说明:Ollama 默认预填充(prefill)与生成(decode)并线,速度取稳定输出值。MoE 的 30B-A3B 虽总参数大,但每次只激活 3B,速度反而接近小模型,是 3090 的「超值之选」。

三、各模型体验点评

Qwen3 8B:日常问答、摘要、翻译完全够用,夏天满载显存占用约 6GB 也不热,是 3090 上的「均衡之选」。

Qwen3 14B:代码与长文质量明显更好,写作和逻辑推理更稳,速度仍丝滑,是普遍推荐档。

Qwen3 30B-A3B(MoE):性价比黑马。激活参数仅 3B,速度接近 8B,但综合能力接近 30B 稠密模型。显存占 18GB 左右,3090 完全可以日常常驻。

Qwen3 32B:4K 上下文下 17 token/s,能跑但已到 3090 的舒适区边缘;经常长文对话建议用 30B-A3B 替代。

四、与更大显存显卡对比

显卡 显存 能跑的最大 Qwen 8B 速度
RTX 3060 12G 12GB 8B(14B 需减层) 约 40 token/s
RTX 3090 24G 24GB 32B / 30B-A3B 约 42 token/s
RTX 4090 24G 24GB 32B / 30B-A3B 约 55 token/s

4090 与 3090 同为 24GB,能跑的模型一样,区别在速度(约 30%)。若预算有限,3090 二手价位下是本地 AI 的「最优解」。

五、3090 的注意事项

  • 供电与温度:3090 满载功耗约 350W,请确认电源 ≥ 750W,机箱通风良好,夏天建议开空调。

  • 显存温度:GDDR6X 温度偏高是正常现象,持续 <100°C 即可。

  • OpenCL / Linux:Linux 下 llm.cpp 与 Ollama 都能直接吃满 24GB,Windows 记得更新驱动到最新。

小结

RTX 3090 对本地 Qwen 玩家来说「大小通吃」:7B/14B 轻松全量,30B-A3B(MoE)是甜点神卡、性价比极高,32B 也勉强能战。如果你正在观望二手 3090,它作为本地大模型主力卡的体验远超同价位新品。

延伸阅读: