Qwen 系列(通义千问)

★★★★★ 5 分

全球最受欢迎的国产开源模型系列,从 0.6B 到 235B 全尺寸覆盖,中文与多语言能力一流,支持 O 系列思维链推理与 MoE 架构,一张 RTX 3060 就能本地跑起来。

中文通用开源全尺寸
参数量0.6B / 1.5B / 3B / 4B / 7B / 14B / 32B / 72B / 235B
模型类型对话大语言模型(含推理、代码、视觉变体)
许可证Apache 2.0
开发者阿里巴巴 / 通义实验室
★★★★★ 5

全球最受欢迎的国产开源全能与多模态系列

中文全能开源多模态全尺寸覆盖

模型介绍

Qwen(通义千问)是阿里巴巴通义实验室出品的世界级开源大模型系列,覆盖 0.6B 到 397B 的全尺寸矩阵,从端侧小模型到多卡旗舰一应俱全。2025 年发布的 Qwen3 引入 Thinking 与非 Thinking 双模式,基于 Apache 2.0 完全可商用;2026 年的 Qwen3.5 系列进一步将上下文提至 262K、并原生支持图像与视频等多模态理解。凭借极强的中文和多语言能力、完善的开源生态(vLLM/SGLang/Ollama 全部官方适配)以及丰富的中文教程,Qwen 是本地部署和国产开源的首选。

模型基本信息

开发机构阿里巴巴 / 通义实验室
模型版本Qwen3.5 / Qwen3(2026)
参数规模0.6B~397B:0.6B/1.7B/7B/8B/14B/27B/30B/32B 稠密 + 35B-A3B/122B-A10B/235B-A22B/397B-A17B MoE
模型类型文本对话 / 多模态(图像·视频)
许可证Apache-2.0
上下文长度262K(Qwen3.5);128K(Qwen3)
发布日期2025-04-27(Qwen3-8B);2026-02-24(Qwen3.5-35B-A3B/27B)
模型架构GQA Transformer;MoE 变体(256 专家激活 3B)采用混合线性注意力 + 张量并行友好设计

模型能力

中文能力很强
英文能力很强
代码能力很强
推理能力很强(Thinking 模式)
长文本能力很强(262K)
视觉能力强(原生多模态)
工具调用很强

模型版本

Qwen3.5-35B-A3B35B-A3B MoE(通用旗舰)Qwen3.5-27B27B 稠密Qwen3-235B-A22B235B-A22B MoEQwen3-32B32B 稠密Qwen3-8B8B 稠密(单卡首选)Qwen2.5-72B72B 稠密Qwen2.5-7B-Instruct7B 稠密

模型获取

部署方式

OllamaLM Studiollama.cppvLLMSGLangtransformers

显存需求

Qwen3-8B Q4约6GB
Qwen3.5-27B Q4约17GB
Qwen3.5-35B-A3B Q4约20GB

硬件推荐

RTX 3060Qwen3 0.6B~8B(Q4)
RTX 30908B~14B Q4,27B Q4 极限可跑
RTX 409027B~32B Q4,35B-A3B Q4 约20GB
RTX 509035B-A3B~122B-A10B(Q4/多卡)
MacM4 Ultra 96GB 可跑 35B-A3B/32B Q4

推荐配置

入门RTX 3060 12G + Qwen3-8B Q4 约6GB(约40 token/s)
进阶RTX 4090 24G + Qwen3.5-35B-A3B Q4 约20GB
专业RTX 5090 ×2 或 A100/H100 集群 + Qwen3.5-397B-A17B / Qwen3-235B-A22B

为什么选择这个模型

  • 中文与多语言能力业界一流,Apache-2.0 完全可商用
  • 从 0.6B 到 397B 全尺寸覆盖,端侧到集群通吃
  • Qwen3.5 原生多模态与 262K 超长上下文
  • vLLM/SGLang/Ollama 官方适配,教程与社区资料最丰富

模型优点

  • 中文效果好且全责开源
  • Thinking/非 Thinking 双模式按需切换
  • 262K 上下文可处理长文档
  • 多模态(Qwen3-VL / Omni)生态完整
  • 中国团队,中文社区维护活跃

模型缺点

  • MoE 旗舰版本显存门槛高(235B/397B 需多卡)
  • Qwen3.5 新版本资料尚在完善
  • 最大稠密版 32B 以上单卡难以 FP16 部署
  • 小尺寸(0.6B)能力有限

适合场景

  • 中文对话与内容创作
  • 代码生成与函数调用
  • 本地私有化与 RAG 知识库
  • 多模态文档/截图理解
  • 长文本总结与翻译

不适合场景

  • 追求绝对推理上限的竞赛数学(可换推理模型)
  • 单卡想跑 Max 旗舰 MoE
  • 视觉视频生成需另有专用模型
  • 严格离线的最小端侧设备

部署教程

Ollama
brew install ollama && ollama run qwen3.5:35b(8/14/27B 换标签即得)
LM Studio
打开 LM Studio → 搜索 qwen3.5-35b 下载 GGUF → 加载并选择 GPU 加速 → 聊天
llama.cpp
从 HF 下载 GGUF 权重,命令:./llama-cli -m qwen3.5-35b-a3b-q4_K_M.gguf -p 提示词 -ngl 999
vLLM
pip install vllm && vllm serve Qwen/Qwen3.5-35B-A3B-Instruct --quantization awq

智算工坊实验室

实测速度Qwen3-8B Q4 实测 ≈42 token/s(RTX 3060);Qwen3.5-35B-A3B Q4 约 25-40 token/s(RTX 4090/双卡)
显存占用Qwen3-8B Q4 约6GB;Qwen3.5-27B Q4 约17GB
功耗RTX 3060 满载约 170W;RTX 4090 满载约 450W
不同 GPU 对比RTX 3060 只能跑 8B 及以下;RTX 3090 逼近 27B 门槛;35B-A3B MoE 需 24GB+ 显存,RTX 4090/5090 明显提速
→ 查看实验室数据

常见问题 FAQ

如何区分 Qwen3 与 Qwen3.5?

Qwen3.5 是 2026 年 2 月发布的新一代,上下文 262K、原生多模态;Qwen3(2025 年)为 128K 纯文本,Ollama 中 qwen3.5 为独立标签。

35B-A3B 的 MoE 是什么意思?

总参数 35B,但每次推理只激活 3B 专家,兼顾容量与速度,Q4 后仅约 20GB 显存即可运行。

相关模型

相关工具

相关硬件

相关文章

数据来源

  • https://huggingface.co/Qwen/Qwen3-8B
  • https://huggingface.co/Qwen/Qwen3-235B-A22B
  • https://huggingface.co/Qwen/Qwen3.5-35B-A3B
  • https://qwenlm.github.io/blog/qwen3/
  • https://qwenlm.github.io/blog/qwen3.5/