GLM 5.2 正式开源!百万上下文、Agent 编程能力登顶,模型下载及本地部署!
GLM 5.2 正式开源!百万上下文、Agent 编程能力登顶,模型下载及本地部署!
2026 年 6 月 17 日,智谱 AI 正式发布并开源了新一代旗舰基座模型 GLM-5.2。这是一款专注 Coding(编程) 和 长程任务(Long-Horizon Task) 的模型,在 Artificial Analysis 综合榜单上以 51 分 与 Anthropic、OpenAI 并列前三,成为开源模型中的最佳表现者。
一句话总结:国内第一款达到 Opus 级的大模型,MIT 协议开源,人人可部署。
🔥 核心亮点速览
| 特性 | 规格 |
|---|---|
| 上下文窗口 | 1M tokens(百万级),无损可用,实测稳定处理 88 万+ tokens |
| 模型架构 | 744B 总参数 MoE,每 token 激活约 40B 参数 |
| 输出上限 | 131,072 tokens |
| 开源协议 | MIT License(最宽松,可商用、修改、再分发) |
| 思考档位 | 引入 effort level 控制,在能力、速度、成本间平衡 |
| 国产算力 | Day 0 适配八大国产算力平台 |
📊 榜单成绩
GLM-5.2 在多个权威评测中取得了极具竞争力的成绩:
| 测试项 | 成绩 | 排名/对比 |
|---|---|---|
| Code Arena(前端开发盲测) | 1595 分 | 全球可用模型第一 🏆 |
| Design Arena(审美品味) | 1360 分 | 全球第一 🏆 |
| Artificial Analysis 综合 | 51 分 | 开源模型 SOTA,与 Anthropic、OpenAI 并称"新御三家" |
| FrontierSWE(超长程软件工程) | - | 仅比 Claude Opus 4.8 低 1%,超过 GPT-5.5 |
| Terminal-Bench 2.1 | 81.0 | 较 GLM-5.1 提升 17.5% |
| SWE-bench Pro | 62.1 | 超过 GPT-5.5(58.6) |
| MCP-Atlas(工具使用) | - | 仅比 Opus 4.8 低 0.8% |
开发者评价其为:"国内第一款在我工作流上达到 Opus 级的模型",编程能力"已难以与 Claude Opus 区分"。
🧠 核心技术架构:IndexShare 创新
GLM-5.2 的核心技术突破来自推理基础设施和模型架构的协同优化,智谱提出了四套组合方案:
1. IndexShare + KVShare(MTP 层优化)
- 多步 MTP(Multi-Token Prediction)中仅在第一步计算索引器(Indexer)
- 后续步骤直接复用 topk 索引,不再重复注意力计算
- 在 1M 上下文长度下,将单位 token 的 FLOPs 降低至 2.9 倍
- 用于投机解码的 MTP 层接受长度最多提升 20%
2. LayerSplit(已在前代验证)
- 针对 Coding Agent 工作负载(上下文长、Prefix 缓存命中率高)
- 每张 GPU 仅持有部分层的 KV Cache,降低单卡显存占用
- 设计了"KV Cache 广播与 Indexer 计算的重叠机制"
- 额外引入的开销仅为 KV Cache 体量 1/8 的 Indexer Cache 广播
- 在 32k~1024k 请求长度区间,系统吞吐量较 GLM-5.1 实现 3%~192% 的提升
3. HiSparse(分层内存系统)
- 将非活跃 KV 缓存条目卸载至主机内存
- 在 GPU HBM 中维护热点设备缓存区,存放高频访问区域
4. Thinking Effort(思考档位)
- 新增 High 与 Max 两档思考强度设定
- 允许在能力、速度、成本之间动态平衡
💻 Agent 编程能力实测
4 小时从零构建《文明》复刻版
在一次实际测试中,GLM-5.2 使用 Godot 引擎、GDScript,从零开始构建了《文明》游戏的复刻版本:
- M0 阶段:创建十几个文件,生成标准地图网格和基础游戏单位
- Bug 修复:逐一修复信息面板无法打开、初始单位无法移动等问题,"每个 bug 的修复基本都可以在一两轮对话中完成"
- M2 阶段:模型自主判断加入战斗系统、科技树、城市经济和资源限制四大子系统,持续工作 30 多分钟
- 上下文利用:跑到后期窗口已达 30 万+ tokens,模型仍能严格遵守开发规则
- 主动优化:M3 阶段模型主动将地形渲染拆分为静态和动态层,为小地图加缓存优化
- 审美能力:M4 阶段自主找素材更新图标、重新设计交互卡片
- 跨上下文定位 bug:成功定位从 M0 版本就存在的 UI 控件隐藏 Bug(地图放大后才显现)
最终统计:总计使用 87 万上下文窗口,修复 16 个 Bug,模型能准确回忆每个 Bug 的原因和解法。
30 小时播客实录分析
一次性上传 13 份 AI 播客实录(约 25 万词、30 万+ tokens):
- ✅ 跨期观点追踪:成功追踪"Scaling Law 是否遇到瓶颈"的讨论轨迹,总结出 Scaling Law 从单一预训练扩展为四条曲线的演变
- ✅ 主题聚类:1 分钟梳理出 9 大主题,含共识摘要与待解争议,"抽检了几个关键的引语,发现基本没有出现幻觉"
- ✅ 对比 GLM-5.1(20 万上下文窗口),5.1 虽能读完但只是逐文件汇总,无法理解"观点在不同时期如何变化、彼此之间有何联系"
全栈应用开发
在一次长程任务中,GLM-5.2 自主完成了覆盖 Web、移动端与小程序的多端应用全链路开发——从开发、联调、测试到打包上线,累计处理超过 88 万 tokens。过去这类工程需要"一支团队协作数周"。
💰 API 使用与定价
API 接入
# 环境变量配置
export ZAI_API_KEY="zai-..."
# OpenAI 兼容客户端(Cline、OpenCode、Roo Code 等)
export OPENAI_BASE_URL="https://api.z.ai/api/coding/paas/v4"
export OPENAI_API_KEY="$ZAI_API_KEY"
export OPENAI_MODEL="glm-5.2[1m]" # 启用 1M 上下文
# Claude Code 切换到 GLM 5.2
export ANTHROPIC_BASE_URL="https://api.z.ai/api/anthropic"
export ANTHROPIC_AUTH_TOKEN="$ZAI_API_KEY"
export ANTHROPIC_MODEL="glm-5.2[1m]"
export API_TIMEOUT_MS="3000000"
Python SDK 调用
import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.z.ai/api/coding/paas/v4",
api_key=os.environ["ZAI_API_KEY"],
)
resp = client.chat.completions.create(
model="glm-5.2[1m]",
messages=[{"role": "user", "content": "用 Python 写一个反转链表的函数"}],
temperature=0.7,
max_tokens=1024,
)
print(resp.choices[0].message.content)
短输入约 5 秒内返回;1M 上下文调用首 token 约 30~90 秒。
Pricing 档位
| 档位 | 价格 | 适用场景 |
|---|---|---|
| Lite | ~$10/月 | 个人轻量使用 |
| Pro | ~$30/月 | 独立开发者 |
| Max | ~$80/月 | 重度 Agent 重构 |
| Team | 按席位 | 3 人以上团队 |
🔧 本地部署完整指南
GLM-5.2 采用 MIT 开源协议,权重可在 Hugging Face 和 ModelScope 自由下载、部署与商用。
模型下载
# 安装依赖
pip install huggingface-hub
# 下载 FP8 版本(推荐生产用)
huggingface-cli download zai-org/GLM-5.2-FP8 \
--local-dir /data/models/glm52-fp8 \
--local-dir-use-symlinks False
# 或使用国内镜像加速
HF_ENDPOINT=https://hf-mirror.com huggingface-cli download zai-org/GLM-5.2-FP8 \
--local-dir /data/models/glm52-fp8
量化档位与硬件需求
GLM-5.2 是 744B MoE 模型,不同量化精度对应不同硬件门槛:
| 量化档位 | 磁盘占用 | 最低内存 | 典型配置 | 推理速度 |
|---|---|---|---|---|
| UD-IQ2_XXS (2-bit) | 241 GB | 256 GB 统一内存 | M4 Ultra Mac Studio | ~3-5 tok/s |
| Q2_K_XL (2-bit) | ~280 GB | 300 GB | 1×24GB GPU + 300GB RAM | ~8.7 tok/s |
| Q4_K_M (4-bit) | ~476 GB | 500 GB+ | 多卡 A100 80GB | ~5-8 tok/s |
| FP8 | ~754 GB | 800 GB+ | 8×H200 SXM5 | ~8-10 tok/s |
| FP16 原版 | ~1.7 TB | 1.7 TB+ | 企业 GPU 集群 | 最佳精度 |
🚀 方案一:vLLM 部署(推荐生产环境)
vLLM ≥ 0.23.0 原生支持 GLM-5.2 FP8 权重,适合高并发生产场景。
# 安装 vLLM
pip install vllm==0.23.0
# 或使用 Docker
docker pull vllm/vllm-openai:nightly
启动服务(标准 128K 上下文):
vllm serve "zai-org/GLM-5.2-FP8" \
--tensor-parallel-size 8 \
--max-model-len 262144 \
--kv-cache-dtype fp8_e5m2 \
--enable-prefix-caching \
--enable-chunked-prefill \
--enable-expert-parallel \
--gpu-memory-utilization 0.92 \
--port 8000
启动服务(1M 上下文):
python -m vllm.entrypoints.openai.api_server \
--model /data/models/glm52-fp8 \
--served-model-name glm52-fp8 \
--tensor-parallel-size 8 \
--quantization fp8 \
--enable-expert-parallel \
--max-model-len 1048576 \
--kv-cache-dtype fp8_e5m2 \
--gpu-memory-utilization 0.92 \
--enable-chunked-prefill \
--max-num-chunked-tokens 32768 \
--max-num-seqs 1 \
--port 8000
客户端调用:
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:8000/v1",
api_key="not-needed"
)
response = client.chat.completions.create(
model="zai-org/GLM-5.2-FP8",
messages=[
{"role": "user", "content": "用 Python 写一个快速排序算法"}
],
max_tokens=512,
temperature=0.7
)
print(response.choices[0].message.content)
🚀 方案二:SGLang 部署(推荐长上下文/Agent)
SGLang 内置 RadixAttention,在多轮 Agent 和长文档 RAG 场景吞吐比 vLLM 高 3 倍。
# 安装
pip install 'sglang[all]>=0.5.10'
# 或 Docker
docker pull lmsysorg/sglang:latest
启动服务(1M 上下文):
python -m sglang.launch_server \
--model-path /data/models/glm52-fp8 \
--tp 8 \
--quantization fp8 \
--enable-moe-ep \
--context-length 1048576 \
--mem-fraction-static 0.88 \
--kv-cache-dtype fp8_e5m2 \
--port 30000
Docker 启动:
docker run --gpus all \
--shm-size 32g \
-p 30000:30000 \
-v /data/models/glm52-fp8:/models/glm52-fp8 \
-v ~/.cache/huggingface:/root/.cache/huggingface \
--env "HF_TOKEN=<your_token>" \
--ipc=host \
lmsysorg/sglang:latest \
python3 -m sglang.launch_server \
--model-path /models/glm52-fp8 \
--host 0.0.0.0 \
--port 30000 \
--tp 8 \
--context-length 262144 \
--kv-cache-dtype fp8_e4m3
🚀 方案三:Ollama 一键部署(最简方案)
# 一行命令搞定
ollama pull glm5
ollama run glm5
🚀 方案四:Transformers 直接使用(调试/小规模)
from transformers import AutoTokenizer, AutoModelForCausalLM
import torch
model_name = "zai-org/GLM-5.2-FP8"
tokenizer = AutoTokenizer.from_pretrained(model_name, trust_remote_code=True)
model = AutoModelForCausalLM.from_pretrained(
model_name,
torch_dtype=torch.float16,
device_map="auto",
trust_remote_code=True
)
messages = [{"role": "user", "content": "什么是 MoE 架构?请详细解释。"}]
inputs = tokenizer.apply_chat_template(
messages,
add_generation_prompt=True,
tokenize=True,
return_dict=True,
return_tensors="pt"
).to(model.device)
outputs = model.generate(
**inputs,
max_new_tokens=256,
temperature=0.7,
do_sample=True
)
response = tokenizer.decode(
outputs[0][inputs["input_ids"].shape[-1]:],
skip_special_tokens=True
)
print(response)
🏗️ 部署框架选型建议
| 框架 | 吞吐量 | 长上下文 | 多轮 Agent | 推荐场景 |
|---|---|---|---|---|
| vLLM | ⭐⭐⭐⭐ | ⭐⭐⭐ | ⭐⭐⭐ | 高并发 API 生产 |
| SGLang | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | 长上下文 / Agent |
| llama.cpp | ⭐⭐⭐ | ⭐⭐ | ⭐⭐ | Mac / 单机调试 |
| Ollama | ⭐⭐⭐ | ⭐⭐ | ⭐⭐ | 一键体验 |
选型建议:高并发 API 服务用 vLLM,长上下文和 Agent 场景用 SGLang,Mac 用户用 llama.cpp GGUF。
🇨🇳 国产算力适配
GLM-5.2 在 Day 0 即完成与以下国产算力平台的推理适配:
- 华为昇腾(预计下半年 950 超节点纳入支持)
- 平头哥(含光)
- 摩尔线程
- 寒武纪
- 昆仑芯
- 沐曦
- 海光
- 壁仞
- 天数智芯
智谱在国产芯片集群上实现了"高吞吐、低延迟、大并发的稳定运行"。
🐛 常见问题排查
| 问题 | 原因 | 解决 |
|---|---|---|
401 invalid_api_key |
Key 范围选错 | 重新生成 Coding Plan 范围 Key |
model not found |
模型 ID 错误 | 使用 glm-5.2[1m] 或纯 glm-5.2 |
429 |
Lite 档配额耗尽 | 升级 Pro 或减少迭代轮数 |
| 空响应无报错 | max_tokens 不足 |
设为 ≥ 4096 |
504 / 超时 |
首 token 超客户端默认超时 | CLI 的 requestTimeoutMs 调到 600000 |
| 显存不足(OOM) | 硬件不够 | 降低 --max-model-len 或启用 FP8 KV Cache |
🔮 展望:完全自治的智能体系统
智谱明确将下一目标定位为 完全自治的智能体系统(Autonomous Agent System),让 AI 实现自主驱动、协同作业、7×24 小时运转。核心技术攻关方向包括:
- Memory(长期记忆)
- Continual Learning(持续学习)
- Self-Judge(自我评判)
创始人唐杰指出,这一方向将加速行业从 "一人公司"向"无员工公司" 演进。
📁 资源汇总
| 资源 | 链接 |
|---|---|
| 模型权重 (Hugging Face) | zai-org/GLM-5 |
| 模型权重 (ModelScope) | ZhipuAI/GLM-5.2 |
| GitHub 仓库 | zai-org/GLM-5 |
| 官方 API | BigModel 开放平台、Z.ai |
| 在线体验 | chat.z.ai 或智谱清言 App |
| 技术博客 | z.ai/blog/glm-5.2 |
| SGLang Cookbook | GLM-5 部署指南 |
| KTransformers 异构推理 | GitHub |
| 阿里云部署实战 | GLM 5.2 自托管全流程 |
GLM-5.2 的出现标志着国产大模型首次跻身全球顶尖编程模型行列,以 MIT 协议开源更意味着真正的技术平权。无论你是想通过 API 快速接入,还是拥有自己的 GPU 集群进行本地部署,现在就能上手体验这款"Opus 级"的开源模型。