清华系国产老牌劲旅,1M 上下文先行者
模型介绍
GLM 系列出自智谱AI(Zhipu AI),是国内最早探索开源大模型的团队之一,从 2023 年的 ChatGLM 一路演进到 2024 年的 GLM-4-9B(MIT 开放)与 2025-2026 年的 GLM-4.5/GLM-5 系列。GLM 以「编程与 Agent」见长:GLM-4.5-Air 用 106B MoE 在主流通用评测中对标 350B 级模型,2026 年的 GLM-5.2 更以约 744B MoE 与 1M 上下文登顶多个开源智能基准,并官方给出国产网络上少有的高质量中文推理链。9B 版本仍是消费级单卡的不错选择。
模型基本信息
开发机构智谱AI(Zhipu AI / Z.ai,清华系)
模型版本GLM-5.2(2026)/ GLM-4.5 / GLM-4
参数规模GLM-4-9B 稠密;GLM-4.5-Air 106B-A12B MoE;GLM-4.5 355B-A32B MoE;GLM-5.2 约 744B/753B MoE
模型类型文本对话 / 编程 / Agent
许可证MIT(GLM-4.5/GLM-5.x);GLM-4-9B 为自定义
上下文长度128K(GLM-4-9B / GLM-4.5 支持长上下文);1M(GLM-5.2)
发布日期2024-06-04(GLM-4-9B);2025-07-20(GLM-4.5-Air);2026-06-16(GLM-5.2)
模型架构GLM-4-9B:ChatGLM 架构(共享注意力/偏置);GLM-4.5/5 为 MoE + 动态稀疏注意力(GlmMoeForCausalLM / GlmMoeDsaForCausalLM)
模型能力
中文能力很强
英文能力很强
代码能力很强(编程 Agent)
推理能力很强
长文本能力很强(1M / GLM-5.2)
视觉能力中(另一 GLM-4V 视觉模型)
工具调用很强(Agent)
模型版本
GLM-5.2约 753B-A? MoE(1M 上下文)GLM-4.5-Air106B-A12B MoEGLM-4.5-355B-A32B355B-A32B MoEGLM-4-9B-04149B 稠密(MIT 开源)ChatGLM3-6B6B 稠密(经典)
模型获取
部署方式
OllamaLM Studiollama.cppvLLMSGLangtransformers
显存需求
GLM-4-9B Q4约6GB
GLM-4.5-Air Q4约60GB(集群/多卡)
GLM-5.2需多卡集群(FP8)
硬件推荐
RTX 3060GLM-4-9B(Q4)
RTX 3090GLM-4-9B Q4 舒适;4.5-Air 需量化多卡
RTX 4090GLM-4-9B FP16;Agent 场景 GPU 皮更高
RTX 5090仍以 9B/中等规模为主
MacM 系列可跑 GLM-4-9B Q4
推荐配置
入门RTX 3060 12G + GLM-4-9B Q4 约6GB
进阶RTX 4090 24G + GLM-4-9B FP16 / GLM-4.5-Air(量化)
专业A100/H100 ×4 + GLM-4.5-355B / GLM-5.2(FP8)
为什么选择这个模型
- 国产老牌,中文与中文代码生态成熟
- 1M 上下文在国产开源中领先
- MIT 授权(GLM-4.5/5 系列)可商用
- 编程与 Agent 智能体能力突出
模型优点
- 中文与代码强
- GLM-4.5-Air 以小博大(106B MoE 对标 350B)
- 1M 长上下文(GLM-5.2)
- Agent 工具调用成熟
- 国产团队 + MIT
模型缺点
- 旗舰 355B/753B 无法消费级部署
- 9B 版本能力上限明显
- 早期 GLM-4-0 版本许可有过争议
- 生态工具不如 Qwen 齐全
适合场景
- Agentic Coding 与工具链
- 长文档/长日志分析
- 国产化私有部署(MIT)
- 中文 RAG 与客服
- 1M 长上下文论文库
不适合场景
- 多模态视觉(主系列纯文本)
- 单卡跑旗舰 MoE
- 追求国际英文生态兼容
- 移动端(9B 以上偏重)
部署教程
Ollama
ollama run glm4:9b
LM Studio
LM Studio 搜索 THUDM/zai-org glm-4 GGUF → 加载 → 使用
llama.cpp
./llama-cli -m glm-4-9b-chat-q4_k_m.gguf -p 提示词 -ngl 999
vLLM
pip install vllm && vllm serve zai-org/GLM-4-9B-Chat(或 GLM-4.5-Air)
智算工坊实验室
实测速度GLM-4-9B Q4 实测 ≈38-40 token/s(RTX 3060/3090)
显存占用GLM-4-9B Q4 约6GB
功耗RTX 3060 满载约170W
不同 GPU 对比9B 在 3060 与 4090 差距约 25%;MoE 大版本需多卡显存分配
常见问题 FAQ
GLM 开源许可证如何?
GLM-4-9B-0414 及之后的 GLM-4.5/GLM-5 系列采用 MIT;更早的 GLM-4-9B 初版为自定义许可,注意区分。Z.ai 官网可查。
9B 能跑 Agent 吗?
可以配合 Structured tools / function calling,适合轻量工具链;重编程任务建议用 GLM-4.5-Air 及以上。
相关模型
相关工具
相关硬件
相关文章
数据来源
- https://huggingface.co/zai-org/glm-4-9b-chat
- https://huggingface.co/zai-org/GLM-4.5-Air
- https://z.ai/blog
- https://huggingface.co/zai-org/GLM-5.2