智谱 Z.ai · 新一代旗舰模型 · 2026.08.14 发布

GLM-5.3

FRONTIER CODING · EMERGENT CYBER CAPABILITIES
前沿编程,涌现而出。

与 GLM-5.2 相同的基座模型,纯粹的后训练 Scaling—— 复杂编程、长程 Agent 与网络安全能力全面跃迁,成为当前编程能力最强的开源权重模型。

744B MoE 总参数 · ~40B 激活 1M 上下文窗口 三档思考 low / high / max 权重即将开源

开源权重将在安全评估与加固完成后开放(发布后约两周内)· 已全量上线 GLM Coding Plan

84.5
CyberGym 全球最佳
+50%
Z.ai Code Bench 提升
0%
Z.ai Code Bench 较 GLM-5.2 提升(官方口径)
0×
Terminal Bench 3.0 得分跃迁(4.6 → 28.3)
0
CyberGym 漏洞发现得分 · 全场最佳
0
真实代码库漏洞发现 · 覆盖 269 个开源项目
Three Big Leaps

基座不变,一代之内的三次跃升

GLM-5.3 与 GLM-5.2 共用同一个基础模型,所有提升都来自后训练 Scaling—— 更多环境、更多样的任务、更大规模的训练算力,沿着 GLM-5.2 建成的 IndexShare / SAO / slime 技术栈继续放大。

更强的编程

开源权重中的编程能力第一:内部基准 Z.ai Code Bench 较 GLM-5.2 提升 50%, 并在 Terminal Bench 3.0、Agents' Last Exam 等公开基准上取得开源 SOTA。 训练环境从「编程习题」走向真实工程单元——部分任务相当于资深工程师数天的工作量。

TB 3.0: 4.6 → 28.3 · DeepSWE: 46.2 → 66.9

涌现式网络安全能力

后训练 Scaling 过程中,安全能力的发展超出预期:模型不再只识别孤立缺陷, 而能跨阶段推理完整利用链。CyberGym 漏洞发现 84.5 分全场最佳; 越靠近利用链上游,提升越大——ExploitBench 较 5.2 翻倍以上。

ExploitBench: 24.4 → 54.4 · ExploitGym 2h: 29 → 105

如约开源

延续智谱的开源传统:权重将在安全评估与加固完成后开放下载(发布后约两周内), 届时登陆 HuggingFace。支撑本次升级的后训练框架 slime 已同步开源, 训练-推理一致性、异步调度等关键能力均可在社区复现。

slime: Megatron + SGLang · 单数据流架构
Base Unchanged, Gains Everywhere

同一基座,能力跃迁

以下均为 GLM-5.2 → GLM-5.3 的官方评测对比。注意:两代模型基础参数完全一致, 全部提升来自后训练阶段的规模化投入。

Terminal Bench 3.0×6.2
5.2
4.6
5.3
28.3
DeepSWE v1.1+45%
5.2
46.2
5.3
66.9
SWE-Marathon v1.1×2.2
5.2
19.4
5.3
42.5
ExploitBench×2.2
5.2
24.4
5.3
54.4
ExploitGym(2h 完成任务数)×3.6
5.2
29
5.3
105
HLE w/ Tools(工具增强)+7.8pt
5.2
54.7
5.3
62.5

条形长度按各配对组内数值归一化,仅用于展示相对幅度。数据来源:Z.ai 官方博客(2026-08-14)。

Head-to-Head

权威评测,与全球前沿同台

GLM-5.3 与全球主要前沿模型的公开评测对比。对比模型:Kimi K3、DeepSeek-V4 Pro-0813、 Qwen3.8-Max、Claude Opus 4.8、Claude Fable 5 与 GPT-5.6 Sol。

开源阵营全面领先:GLM-5.3 是当前编程能力最强的开源权重模型; 并在 CyberGym(84.5)、AutomationBench(48.2)、GDPval-AA(1769) 三项基准上超越所有闭源对手,取得全场最佳。
基准GLM-5.3GLM-5.2Kimi K3DeepSeek-V4Qwen3.8-MaxOpus 4.8Fable 5GPT-5.6
Terminal Bench 2.188.281.088.387.986.685.088.088.8
Terminal Bench 3.028.34.617.4——21.133.734.6
DeepSWE v1.166.946.267.562.756.658.069.772.7
NL2Repo58.048.958.061.155.969.7——
ProgramBench(Almost Solved)19.09.517.5—10.515.533.023.0
FrontierSWE78.167.5———66.588.2—
SWE-Marathon v1.142.519.448.1——48.833.142.5
PostTrainBench39.831.732.0——32.941.836.2

● 标记该基准最高分;橙色列为 GLM-5.3;「—」为官方未公布数据。DeepSeek-V4 指 DeepSeek-V4 Pro-0813,Opus 4.8 / Fable 5 为 Anthropic 模型,GPT-5.6 为 GPT-5.6 Sol。数据来源:Z.ai 官方博客《GLM-5.3: Frontier Coding with Emergent Cyber Capabilities》(2026-08-14)。

Smarter Effort

更少 token,更强结果

在内部基准 Z.ai Code Bench(贴近真实用户场景、避免公开测试集污染)上, GLM-5.3 在每一档思考强度下都以更少的输出 token 拿到更高的任务完成率。

0 50K 100K 150K 20% 35% 45% 每任务输出 token → 任务完成率 → ↖ 左上 = 更优区域 Fable 5 · Max 39.5%(token 用量未公布) GLM-5.2 Max · 23.4% Opus 4.8 · 29.5% GLM-5.3 High · 31.4% GLM-5.3 Max · 34.5%
GLM-5.3 GLM-5.2(上代) Claude Opus 4.8
34.5%
Max 档:约 75K 输出 token 即达成,较 GLM-5.2 的 23.4%(需 96K)更强且更省。
31.4%
High 档:约 50K token 反超 Claude Opus 4.8 的 29.5%(后者需约 120K)。
39.5%
与 Claude Fable 5(Max 档 39.5%)仍有差距——前沿之路,仍在继续。
Real-World Impact

从基准到真实世界:
269 个开源项目的安全体检

自 GLM-5.2 起,智谱与国内多个安全团队合作,让模型在真实生产代码库中寻找漏洞。 经专家复核、去重后的成果:

0
漏洞发现总数(Findings)
0
覆盖开源项目
0
中高危漏洞(Critical + High)
0 年
最久隐患的存活跨度(最早引入于 1981 年)

这些发现横跨系统内核、操作系统、浏览器引擎、开源基础设施、Web 应用与网络协议。 许多漏洞已潜伏多年——有的甚至沉睡了约 40 年;平均而言,一个漏洞在被发现前已存在 26.6 年。

Severity Distribution · 严重程度分布
Critical 107 High 990 Medium 1286 Low 53
系统内核操作系统浏览器引擎 开源基础设施Web 应用网络协议
全部发现正通过 Z.ai Security Disclosure Ledger 持续公开追踪: 53 项已公开披露,2,383 项处于披露流程中(embargo),涉及项目、严重程度、CVE 与潜伏年限均可查。
Under the Hood

技术内核:把 RL Scaling
工程化到极致

当模型能力提升后,后训练的瓶颈从模型转移到环境——任务环境必须可执行、可验证、贴近真实专业工作,而且需要很多个。 GLM-5.3 的答案是一套完整的环境合成与训练基建。

slime

开源 · RL 框架

面向长程 RL Scaling 的后训练框架:训练侧 Megatron、rollout 侧 SGLang, 训练 / rollout / 数据缓冲统一在单数据流上——数学、代码、沙箱、验证器、长程环境以「数据生成」的形式即插即用, 无需为每个环境改造训练循环。

环境合成管线

规模化造环境

Research Agent 从真实工作中采集任务模式,转化为带多步依赖与隐藏状态的可运行长程环境; Judge Agent 逐一试解以验证可解性。Verifier 在不接触参考解的条件下合成, 并用 solver 轨迹发现并封堵 reward shortcuts,产出可直接训练的二值奖励。

IndexShare

长上下文

高效长上下文处理技术,支撑 1M token 级项目工程上下文的稳定读写, 让「项目级」的代码理解与修改成为可能,而不是停留在片段式补全。

SAO + compaction

长程 RL 算法

面向长程任务的强化学习策略(自 GLM-5.2 延续),配合 compaction 技术, 确保增益在长任务上同样成立,而非只在短任务上过拟合。

2.3×
长程编码 RL 任务端到端训练吞吐提升——来自 router 与 slime 的联合调度、负载感知的吞吐参数推导
1e-7
训练-推理 logprob 平均差异控制到该量级,较此前方案降低 99.99% 以上,保证策略一致性
Get Started

三行代码,立即接入

模型 ID:glm-5.3。三档思考强度 low / high / max(编码任务推荐 max), API 定价与上代 GLM-5.2 持平。已全量上线 GLM Coding Plan,可在 ZCode、Claude Code、OpenCode 等编程智能体中使用。

# GLM-5.3 · 三档思考:low / high / max(编码推荐 max)
curl https://api.z.ai/api/paas/v4/chat/completions \
  -H "Authorization: Bearer $ZAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3",
    "thinking": { "type": "enabled" },
    "reasoning_effort": "max",
    "messages": [
      { "role": "user", "content": "诊断这个训练脚本的吞吐瓶颈,并端到端优化" }
    ]
  }'
迁移提示:GLM-5.3 不再支持关闭思考(thinking.type: "disabled")。 若你的应用正在使用 disabled,请先改为 enabled 并搭配 reasoning_effort: "low", 再切换模型 ID 为 glm-5.3,否则请求会失败。
输入
$1.4 /1M
国内平台 ¥8 / 百万 tokens
输出
$4.4 /1M
国内平台 ¥28 / 百万 tokens
缓存命中
$0.26 /1M
国内平台 ¥2 / 百万 tokens

定价与 GLM-5.2 持平。GLM Coding Plan 已改为积分制:非高峰时段半价(高峰为工作日 14:00–18:00 UTC+8,其余时段及周末均 5 折)。

在编程智能体中使用

ZCode:98%+ 缓存命中率,重复上下文按缓存价计费,有效 token 约 +30%;8 月 31 日前限量 1.5× 配额加成
Goal 模式:规划 → 编码 → 测试 → 验证自动闭环,直到目标达成为止
Remote Control:长任务跑在云端,手机上通过微信 / 飞书随时监控与接管
ZCodeClaude CodeOpenCodeGLM Coding Plan
Timeline

从全球征集到如约开源

GLM-5.3 的诞生,从一次公开的意见征集开始。

2026.06.29

全球意见征集

智谱首席科学家唐杰在 X(Twitter)发起全球征集,为计划发布的 GLM-5.3 收集功能建议——社区需求直接进入这一代的议程。

2026.08.14

GLM-5.3 正式发布

API 全量上线,GLM Coding Plan 同步接入;编程能力登顶开源阵营,CyberGym 漏洞发现取得全场最佳,安全能力意外涌现。

2026.08 下旬(预计)

开源权重开放

安全评估与加固完成后,权重将开放下载并登陆 HuggingFace——「开源第一编程模型」的称号,即将可以被任何人本地验证。