与 GLM-5.2 相同的基座模型,纯粹的后训练 Scaling—— 复杂编程、长程 Agent 与网络安全能力全面跃迁,成为当前编程能力最强的开源权重模型。
开源权重将在安全评估与加固完成后开放(发布后约两周内)· 已全量上线 GLM Coding Plan
GLM-5.3 与 GLM-5.2 共用同一个基础模型,所有提升都来自后训练 Scaling—— 更多环境、更多样的任务、更大规模的训练算力,沿着 GLM-5.2 建成的 IndexShare / SAO / slime 技术栈继续放大。
开源权重中的编程能力第一:内部基准 Z.ai Code Bench 较 GLM-5.2 提升 50%, 并在 Terminal Bench 3.0、Agents' Last Exam 等公开基准上取得开源 SOTA。 训练环境从「编程习题」走向真实工程单元——部分任务相当于资深工程师数天的工作量。
后训练 Scaling 过程中,安全能力的发展超出预期:模型不再只识别孤立缺陷, 而能跨阶段推理完整利用链。CyberGym 漏洞发现 84.5 分全场最佳; 越靠近利用链上游,提升越大——ExploitBench 较 5.2 翻倍以上。
延续智谱的开源传统:权重将在安全评估与加固完成后开放下载(发布后约两周内), 届时登陆 HuggingFace。支撑本次升级的后训练框架 slime 已同步开源, 训练-推理一致性、异步调度等关键能力均可在社区复现。
以下均为 GLM-5.2 → GLM-5.3 的官方评测对比。注意:两代模型基础参数完全一致, 全部提升来自后训练阶段的规模化投入。
条形长度按各配对组内数值归一化,仅用于展示相对幅度。数据来源:Z.ai 官方博客(2026-08-14)。
GLM-5.3 与全球主要前沿模型的公开评测对比。对比模型:Kimi K3、DeepSeek-V4 Pro-0813、 Qwen3.8-Max、Claude Opus 4.8、Claude Fable 5 与 GPT-5.6 Sol。
| 基准 | GLM-5.3 | GLM-5.2 | Kimi K3 | DeepSeek-V4 | Qwen3.8-Max | Opus 4.8 | Fable 5 | GPT-5.6 |
|---|---|---|---|---|---|---|---|---|
| Terminal Bench 2.1 | 88.2 | 81.0 | 88.3 | 87.9 | 86.6 | 85.0 | 88.0 | 88.8 |
| Terminal Bench 3.0 | 28.3 | 4.6 | 17.4 | — | — | 21.1 | 33.7 | 34.6 |
| DeepSWE v1.1 | 66.9 | 46.2 | 67.5 | 62.7 | 56.6 | 58.0 | 69.7 | 72.7 |
| NL2Repo | 58.0 | 48.9 | 58.0 | 61.1 | 55.9 | 69.7 | — | — |
| ProgramBench(Almost Solved) | 19.0 | 9.5 | 17.5 | — | 10.5 | 15.5 | 33.0 | 23.0 |
| FrontierSWE | 78.1 | 67.5 | — | — | — | 66.5 | 88.2 | — |
| SWE-Marathon v1.1 | 42.5 | 19.4 | 48.1 | — | — | 48.8 | 33.1 | 42.5 |
| PostTrainBench | 39.8 | 31.7 | 32.0 | — | — | 32.9 | 41.8 | 36.2 |
| 基准 | GLM-5.3 | GLM-5.2 | Kimi K3 | DeepSeek-V4 | Qwen3.8-Max | Opus 4.8 | Fable 5 | GPT-5.6 |
|---|---|---|---|---|---|---|---|---|
| CyberGym(漏洞发现) | 84.5 | 77.2 | 80.0 | 83.3 | 78.5 | 78.1 | 83.8 | 83.6 |
| ExploitGym(2h / 6h 完成数) | 105 / 130 | 29 / 39 | 36 / 70 | — | 14 / 26 | 80 / 120 | 181 / 247 | 216 / 293 |
| ExploitBench(漏洞利用推理) | 54.4 | 24.4 | 32.2 | — | 28.8 | 40.0 | 78.0 | 76.5 |
| 基准 | GLM-5.3 | GLM-5.2 | Kimi K3 | DeepSeek-V4 | Qwen3.8-Max | Opus 4.8 | Fable 5 | GPT-5.6 |
|---|---|---|---|---|---|---|---|---|
| Toolathlon(Verified) | 73.0 | 59.9 | 76.5 | 74.1 | 72.5 | 76.2 | 74.7 | 74.9 |
| AutomationBench v1.0.6 | 48.2 | 26.2 | 46.7 | 43.2 | 39.8 | 41.0 | 46.2 | 45.8 |
| Agents' Last Exam · ALE-CLI | 28.5 | 23.8 | 27.6 | 25.7 | 27.0 | 25.7 | 23.8 | 28.6 |
| HLE w/ Tools | 62.5 | 54.7 | 59.8 | 60.0 | 56.2 | 57.9 | 63.9 | 64.5 |
| GDPval-AA v2(经济价值任务) | 1769 | 1508 | 1682 | 1590 | 1739 | 1588 | 1743 | 1730 |
● 标记该基准最高分;橙色列为 GLM-5.3;「—」为官方未公布数据。DeepSeek-V4 指 DeepSeek-V4 Pro-0813,Opus 4.8 / Fable 5 为 Anthropic 模型,GPT-5.6 为 GPT-5.6 Sol。数据来源:Z.ai 官方博客《GLM-5.3: Frontier Coding with Emergent Cyber Capabilities》(2026-08-14)。
在内部基准 Z.ai Code Bench(贴近真实用户场景、避免公开测试集污染)上, GLM-5.3 在每一档思考强度下都以更少的输出 token 拿到更高的任务完成率。
自 GLM-5.2 起,智谱与国内多个安全团队合作,让模型在真实生产代码库中寻找漏洞。 经专家复核、去重后的成果:
这些发现横跨系统内核、操作系统、浏览器引擎、开源基础设施、Web 应用与网络协议。 许多漏洞已潜伏多年——有的甚至沉睡了约 40 年;平均而言,一个漏洞在被发现前已存在 26.6 年。
当模型能力提升后,后训练的瓶颈从模型转移到环境——任务环境必须可执行、可验证、贴近真实专业工作,而且需要很多个。 GLM-5.3 的答案是一套完整的环境合成与训练基建。
面向长程 RL Scaling 的后训练框架:训练侧 Megatron、rollout 侧 SGLang, 训练 / rollout / 数据缓冲统一在单数据流上——数学、代码、沙箱、验证器、长程环境以「数据生成」的形式即插即用, 无需为每个环境改造训练循环。
Research Agent 从真实工作中采集任务模式,转化为带多步依赖与隐藏状态的可运行长程环境; Judge Agent 逐一试解以验证可解性。Verifier 在不接触参考解的条件下合成, 并用 solver 轨迹发现并封堵 reward shortcuts,产出可直接训练的二值奖励。
高效长上下文处理技术,支撑 1M token 级项目工程上下文的稳定读写, 让「项目级」的代码理解与修改成为可能,而不是停留在片段式补全。
面向长程任务的强化学习策略(自 GLM-5.2 延续),配合 compaction 技术, 确保增益在长任务上同样成立,而非只在短任务上过拟合。
模型 ID:glm-5.3。三档思考强度 low / high / max(编码任务推荐 max), API 定价与上代 GLM-5.2 持平。已全量上线 GLM Coding Plan,可在 ZCode、Claude Code、OpenCode 等编程智能体中使用。
# GLM-5.3 · 三档思考:low / high / max(编码推荐 max)
curl https://api.z.ai/api/paas/v4/chat/completions \
-H "Authorization: Bearer $ZAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3",
"thinking": { "type": "enabled" },
"reasoning_effort": "max",
"messages": [
{ "role": "user", "content": "诊断这个训练脚本的吞吐瓶颈,并端到端优化" }
]
}'
# pip install zhipuai
from zhipuai import ZhipuAI
client = ZhipuAI(api_key="YOUR_API_KEY")
resp = client.chat.completions.create(
model="glm-5.3",
thinking={"type": "enabled"},
reasoning_effort="max", # low / high / max
messages=[
{"role": "user",
"content": "诊断这个训练脚本的吞吐瓶颈,并端到端优化"}
],
)
print(resp.choices[0].message.content)
定价与 GLM-5.2 持平。GLM Coding Plan 已改为积分制:非高峰时段半价(高峰为工作日 14:00–18:00 UTC+8,其余时段及周末均 5 折)。
GLM-5.3 的诞生,从一次公开的意见征集开始。
智谱首席科学家唐杰在 X(Twitter)发起全球征集,为计划发布的 GLM-5.3 收集功能建议——社区需求直接进入这一代的议程。
API 全量上线,GLM Coding Plan 同步接入;编程能力登顶开源阵营,CyberGym 漏洞发现取得全场最佳,安全能力意外涌现。
安全评估与加固完成后,权重将开放下载并登陆 HuggingFace——「开源第一编程模型」的称号,即将可以被任何人本地验证。