全球最受欢迎的国产开源全能与多模态系列
模型介绍
Qwen(通义千问)是阿里巴巴通义实验室出品的世界级开源大模型系列,覆盖 0.6B 到 397B 的全尺寸矩阵,从端侧小模型到多卡旗舰一应俱全。2025 年发布的 Qwen3 引入 Thinking 与非 Thinking 双模式,基于 Apache 2.0 完全可商用;2026 年的 Qwen3.5 系列进一步将上下文提至 262K、并原生支持图像与视频等多模态理解。凭借极强的中文和多语言能力、完善的开源生态(vLLM/SGLang/Ollama 全部官方适配)以及丰富的中文教程,Qwen 是本地部署和国产开源的首选。
模型基本信息
开发机构阿里巴巴 / 通义实验室
模型版本Qwen3.5 / Qwen3(2026)
参数规模0.6B~397B:0.6B/1.7B/7B/8B/14B/27B/30B/32B 稠密 + 35B-A3B/122B-A10B/235B-A22B/397B-A17B MoE
模型类型文本对话 / 多模态(图像·视频)
许可证Apache-2.0
上下文长度262K(Qwen3.5);128K(Qwen3)
发布日期2025-04-27(Qwen3-8B);2026-02-24(Qwen3.5-35B-A3B/27B)
模型架构GQA Transformer;MoE 变体(256 专家激活 3B)采用混合线性注意力 + 张量并行友好设计
模型能力
中文能力很强
英文能力很强
代码能力很强
推理能力很强(Thinking 模式)
长文本能力很强(262K)
视觉能力强(原生多模态)
工具调用很强
模型版本
Qwen3.5-35B-A3B35B-A3B MoE(通用旗舰)Qwen3.5-27B27B 稠密Qwen3-235B-A22B235B-A22B MoEQwen3-32B32B 稠密Qwen3-8B8B 稠密(单卡首选)Qwen2.5-72B72B 稠密Qwen2.5-7B-Instruct7B 稠密
模型获取
部署方式
OllamaLM Studiollama.cppvLLMSGLangtransformers
显存需求
Qwen3-8B Q4约6GB
Qwen3.5-27B Q4约17GB
Qwen3.5-35B-A3B Q4约20GB
硬件推荐
RTX 3060Qwen3 0.6B~8B(Q4)
RTX 30908B~14B Q4,27B Q4 极限可跑
RTX 409027B~32B Q4,35B-A3B Q4 约20GB
RTX 509035B-A3B~122B-A10B(Q4/多卡)
MacM4 Ultra 96GB 可跑 35B-A3B/32B Q4
推荐配置
入门RTX 3060 12G + Qwen3-8B Q4 约6GB(约40 token/s)
进阶RTX 4090 24G + Qwen3.5-35B-A3B Q4 约20GB
专业RTX 5090 ×2 或 A100/H100 集群 + Qwen3.5-397B-A17B / Qwen3-235B-A22B
为什么选择这个模型
- 中文与多语言能力业界一流,Apache-2.0 完全可商用
- 从 0.6B 到 397B 全尺寸覆盖,端侧到集群通吃
- Qwen3.5 原生多模态与 262K 超长上下文
- vLLM/SGLang/Ollama 官方适配,教程与社区资料最丰富
模型优点
- 中文效果好且全责开源
- Thinking/非 Thinking 双模式按需切换
- 262K 上下文可处理长文档
- 多模态(Qwen3-VL / Omni)生态完整
- 中国团队,中文社区维护活跃
模型缺点
- MoE 旗舰版本显存门槛高(235B/397B 需多卡)
- Qwen3.5 新版本资料尚在完善
- 最大稠密版 32B 以上单卡难以 FP16 部署
- 小尺寸(0.6B)能力有限
适合场景
- 中文对话与内容创作
- 代码生成与函数调用
- 本地私有化与 RAG 知识库
- 多模态文档/截图理解
- 长文本总结与翻译
不适合场景
- 追求绝对推理上限的竞赛数学(可换推理模型)
- 单卡想跑 Max 旗舰 MoE
- 视觉视频生成需另有专用模型
- 严格离线的最小端侧设备
部署教程
Ollama
brew install ollama && ollama run qwen3.5:35b(8/14/27B 换标签即得)
LM Studio
打开 LM Studio → 搜索 qwen3.5-35b 下载 GGUF → 加载并选择 GPU 加速 → 聊天
llama.cpp
从 HF 下载 GGUF 权重,命令:./llama-cli -m qwen3.5-35b-a3b-q4_K_M.gguf -p 提示词 -ngl 999
vLLM
pip install vllm && vllm serve Qwen/Qwen3.5-35B-A3B-Instruct --quantization awq
智算工坊实验室
实测速度Qwen3-8B Q4 实测 ≈42 token/s(RTX 3060);Qwen3.5-35B-A3B Q4 约 25-40 token/s(RTX 4090/双卡)
显存占用Qwen3-8B Q4 约6GB;Qwen3.5-27B Q4 约17GB
功耗RTX 3060 满载约 170W;RTX 4090 满载约 450W
不同 GPU 对比RTX 3060 只能跑 8B 及以下;RTX 3090 逼近 27B 门槛;35B-A3B MoE 需 24GB+ 显存,RTX 4090/5090 明显提速
常见问题 FAQ
如何区分 Qwen3 与 Qwen3.5?
Qwen3.5 是 2026 年 2 月发布的新一代,上下文 262K、原生多模态;Qwen3(2025 年)为 128K 纯文本,Ollama 中 qwen3.5 为独立标签。
35B-A3B 的 MoE 是什么意思?
总参数 35B,但每次推理只激活 3B 专家,兼顾容量与速度,Q4 后仅约 20GB 显存即可运行。
相关模型
相关工具
相关硬件
NVIDIA GeForce RTX 3060 12GBNVIDIA GeForce RTX 3090NVIDIA GeForce RTX 4090NVIDIA GeForce RTX 5090Apple Mac Studio (M4 Ultra)
相关文章
数据来源
- https://huggingface.co/Qwen/Qwen3-8B
- https://huggingface.co/Qwen/Qwen3-235B-A22B
- https://huggingface.co/Qwen/Qwen3.5-35B-A3B
- https://qwenlm.github.io/blog/qwen3/
- https://qwenlm.github.io/blog/qwen3.5/