GLM 系列(智谱)

★★★★★ 4.8 分

智谱开源的对话模型系列,ChatGLM 进化到 GLM-4,Agent 工具调用能力突出,9B 开源版在消费级显卡即可本地部署,中文能力稳居第一梯队。

中文通用开源全尺寸
参数量GLM-4 9B / GLM-4-32B / GLM-4-Plus / GLM-4.5 全尺寸
模型类型对话大语言模型(含 Agent 工具调用)
许可证MIT(GLM-4-9B)/ 商业授权
开发者智谱AI(Zhipu AI)
★★★★★ 4.8

清华系国产老牌劲旅,1M 上下文先行者

中文编程Agent开源

模型介绍

GLM 系列出自智谱AI(Zhipu AI),是国内最早探索开源大模型的团队之一,从 2023 年的 ChatGLM 一路演进到 2024 年的 GLM-4-9B(MIT 开放)与 2025-2026 年的 GLM-4.5/GLM-5 系列。GLM 以「编程与 Agent」见长:GLM-4.5-Air 用 106B MoE 在主流通用评测中对标 350B 级模型,2026 年的 GLM-5.2 更以约 744B MoE 与 1M 上下文登顶多个开源智能基准,并官方给出国产网络上少有的高质量中文推理链。9B 版本仍是消费级单卡的不错选择。

模型基本信息

开发机构智谱AI(Zhipu AI / Z.ai,清华系)
模型版本GLM-5.2(2026)/ GLM-4.5 / GLM-4
参数规模GLM-4-9B 稠密;GLM-4.5-Air 106B-A12B MoE;GLM-4.5 355B-A32B MoE;GLM-5.2 约 744B/753B MoE
模型类型文本对话 / 编程 / Agent
许可证MIT(GLM-4.5/GLM-5.x);GLM-4-9B 为自定义
上下文长度128K(GLM-4-9B / GLM-4.5 支持长上下文);1M(GLM-5.2)
发布日期2024-06-04(GLM-4-9B);2025-07-20(GLM-4.5-Air);2026-06-16(GLM-5.2)
模型架构GLM-4-9B:ChatGLM 架构(共享注意力/偏置);GLM-4.5/5 为 MoE + 动态稀疏注意力(GlmMoeForCausalLM / GlmMoeDsaForCausalLM)

模型能力

中文能力很强
英文能力很强
代码能力很强(编程 Agent)
推理能力很强
长文本能力很强(1M / GLM-5.2)
视觉能力中(另一 GLM-4V 视觉模型)
工具调用很强(Agent)

模型版本

GLM-5.2约 753B-A? MoE(1M 上下文)GLM-4.5-Air106B-A12B MoEGLM-4.5-355B-A32B355B-A32B MoEGLM-4-9B-04149B 稠密(MIT 开源)ChatGLM3-6B6B 稠密(经典)

模型获取

部署方式

OllamaLM Studiollama.cppvLLMSGLangtransformers

显存需求

GLM-4-9B Q4约6GB
GLM-4.5-Air Q4约60GB(集群/多卡)
GLM-5.2需多卡集群(FP8)

硬件推荐

RTX 3060GLM-4-9B(Q4)
RTX 3090GLM-4-9B Q4 舒适;4.5-Air 需量化多卡
RTX 4090GLM-4-9B FP16;Agent 场景 GPU 皮更高
RTX 5090仍以 9B/中等规模为主
MacM 系列可跑 GLM-4-9B Q4

推荐配置

入门RTX 3060 12G + GLM-4-9B Q4 约6GB
进阶RTX 4090 24G + GLM-4-9B FP16 / GLM-4.5-Air(量化)
专业A100/H100 ×4 + GLM-4.5-355B / GLM-5.2(FP8)

为什么选择这个模型

  • 国产老牌,中文与中文代码生态成熟
  • 1M 上下文在国产开源中领先
  • MIT 授权(GLM-4.5/5 系列)可商用
  • 编程与 Agent 智能体能力突出

模型优点

  • 中文与代码强
  • GLM-4.5-Air 以小博大(106B MoE 对标 350B)
  • 1M 长上下文(GLM-5.2)
  • Agent 工具调用成熟
  • 国产团队 + MIT

模型缺点

  • 旗舰 355B/753B 无法消费级部署
  • 9B 版本能力上限明显
  • 早期 GLM-4-0 版本许可有过争议
  • 生态工具不如 Qwen 齐全

适合场景

  • Agentic Coding 与工具链
  • 长文档/长日志分析
  • 国产化私有部署(MIT)
  • 中文 RAG 与客服
  • 1M 长上下文论文库

不适合场景

  • 多模态视觉(主系列纯文本)
  • 单卡跑旗舰 MoE
  • 追求国际英文生态兼容
  • 移动端(9B 以上偏重)

部署教程

Ollama
ollama run glm4:9b
LM Studio
LM Studio 搜索 THUDM/zai-org glm-4 GGUF → 加载 → 使用
llama.cpp
./llama-cli -m glm-4-9b-chat-q4_k_m.gguf -p 提示词 -ngl 999
vLLM
pip install vllm && vllm serve zai-org/GLM-4-9B-Chat(或 GLM-4.5-Air)

智算工坊实验室

实测速度GLM-4-9B Q4 实测 ≈38-40 token/s(RTX 3060/3090)
显存占用GLM-4-9B Q4 约6GB
功耗RTX 3060 满载约170W
不同 GPU 对比9B 在 3060 与 4090 差距约 25%;MoE 大版本需多卡显存分配
→ 查看实验室数据

常见问题 FAQ

GLM 开源许可证如何?

GLM-4-9B-0414 及之后的 GLM-4.5/GLM-5 系列采用 MIT;更早的 GLM-4-9B 初版为自定义许可,注意区分。Z.ai 官网可查。

9B 能跑 Agent 吗?

可以配合 Structured tools / function calling,适合轻量工具链;重编程任务建议用 GLM-4.5-Air 及以上。

相关模型

相关工具

相关硬件

相关文章

数据来源

  • https://huggingface.co/zai-org/glm-4-9b-chat
  • https://huggingface.co/zai-org/GLM-4.5-Air
  • https://z.ai/blog
  • https://huggingface.co/zai-org/GLM-5.2