2026年8月14日,智谱/Z.ai正式发布新一代旗舰模型 GLM-5.3

这一代最有意思的地方,并不是参数继续扩大。

image.png

恰恰相反——GLM-5.3直接沿用了GLM-5.2的Base Model,主要能力提升来自Post-Training后训练。

智谱官方明确表示,GLM-5.3与GLM-5.2使用相同基座,但在自研Z.ai Code Bench上的编程表现提升约50%,并在Terminal-Bench 3.0、Agents' Last Exam等Coding与Agent测试中刷新了开源模型成绩。模型继续提供1M Token上下文,最大输出达到128K。

换句话说,这次不是:

更大的模型+更多参数=更强能力

而更接近:

同一个Base Model+更大规模真实任务后训练+更长执行轨迹+更复杂Agent环境=GLM-5.3

这也使GLM-5.3成为一个很值得观察的案例:

一个已经训练完成的基础模型,到底还能通过后训练继续挖出多少能力?


GLM-5.3核心规格

项目GLM-5.3
产品定位旗舰基础模型
基座与GLM-5.2相同
主要升级方式Post-Training
输入Text
输出Text
上下文长度1M Token
最大输出128K Token
Thinking支持
Streaming支持
Function Call支持
Context Cache支持
Structured Output支持
MCP支持
APIComing Soon
Coding Plan已开放
ZCode已支持
模型权重计划发布后约两周开放

以上规格来自Z.ai最新GLM-5.3官方文档。

需要特别注意:

现在上线的是模型服务,并不是模型权重同步开源。

Z.ai官方表示,GLM-5.3权重计划在模型发布大约两周后公开;同时其官方账号进一步说明,公开前还会完成相关安全评估并部署适当的防护措施。

按照8月14日发布时间推算,如果安全评估按计划完成,时间大致会落在 8月28日前后。这是根据官方“两周”计划推算,并不是已经公布的精确权重发布日期。


Terminal-Bench 3.0:从4.6直接冲到28.3

这次最显眼的升级之一,就是Terminal-Bench 3.0。

GLM-5.2此前只有:

4.6分。

GLM-5.3直接提高到了:

28.3分。

智谱公布的对比图显示,同一组测试中:

模型Terminal-Bench 3.0
GPT-5.6 Sol34.6
Fable 533.7
GLM-5.328.3
Kimi K317.4
GLM-5.24.6

也就是说,GLM-5.3相较自己的上一代不是小修小补。

从4.6到28.3,提升超过5倍。

同时也明显超过了图表中Kimi K3的17.4。

不过,28.3目前仍低于Fable 5和GPT-5.6 Sol,所以更准确的表述是:

GLM-5.3显著缩小了国产开放模型与闭源前沿模型在Terminal Agent任务上的差距。

而不是“已经全面超过Claude或GPT”。


不只是Terminal-Bench,其他Agent测试也一起涨了

智谱公布的六组核心测试中,GLM-5.3的成绩为:

BenchmarkGLM-5.3GLM-5.2Kimi K3Fable 5GPT-5.6 Sol
Terminal-Bench 3.028.34.617.433.734.6
DeepSWE66.946.267.569.772.7
Agents' Last Exam28.523.827.623.828.6
AutomationBench48.226.246.746.245.8
HLE w/ Tools62.554.759.863.964.5
GDPVal-AA v217691508168217431730

这里其实比Terminal-Bench单项更值得看。

因为GLM-5.3并不是每一项都第一。

例如:


  • DeepSWE仍低于Kimi K3、Fable 5和GPT-5.6 Sol;

  • HLE w/ Tools距离Fable 5和GPT-5.6 Sol还有差距;

  • Terminal-Bench 3.0同样没有超过最强闭源模型。

但在AutomationBench和GDPVal-AA v2上,GLM-5.3反而超过了图表中的几个闭源竞争模型。

这说明它这次的提升更偏向:

实际执行任务、Agent工作流和复杂工程交付。


自研Z.ai Code Bench提升50%

智谱官方给出的另一个核心指标来自内部 Z.ai Code Bench

GLM-5.3相较GLM-5.2:

编程表现提高约50%。

这里的测试重点不是传统:

给一道算法题↓输出代码↓检查答案

而更加接近真实工程:

理解复杂需求↓阅读项目↓寻找相关代码↓制定方案↓跨文件修改↓运行工具↓测试↓发现失败↓重新分析↓继续修改↓完成交付

这也是为什么这一代的训练方式值得单独讲。


基座完全没换,究竟是怎么涨出来的?

官方文档直接明确:

GLM-5.3使用与GLM-5.2相同的Base Model,所有提升均来自Post-Training。

这其实回应了“是不是挤牙膏”的争议。

从参数角度看:

确实没有换新的Base。

但从后训练角度看,智谱这次做的不是简单增加几批Coding题。

训练环境开始从孤立代码问题扩展到完整专家工作流程:

发现问题↓分析方案↓执行↓验证↓最终交付

官方甚至表示,其中部分训练任务的工作量,相当于一名资深工程师连续工作数天;模型需要使用真实计算集群、存储系统、内部文档和代码库完成整个任务。

这和传统SFT最大的区别是:

过去训练模型:

写这个函数。

现在训练Agent:

把这个项目的问题解决掉。

为什么这种训练方式对Coding Agent特别重要?

软件工程本身就不是一次回答。

例如一个Bug可能经历:

读取报错↓搜索代码↓找到调用关系↓形成假设↓修改↓运行↓测试失败↓假设错误↓重新搜索↓修改第二处↓重新测试

真正强的Coding Agent,需要能够在很长时间里持续:


  • 保持目标;

  • 管理上下文;

  • 读取工具反馈;

  • 判断失败原因;

  • 修改自己的策略;

  • 再次执行。

GLM-5.3的后训练就是越来越围绕这种完整轨迹,而不是只提高第一轮答案质量。

所以“基座没换”不一定意味着:

没什么升级。

它反而证明了一个问题:

GLM-5.2的基础能力可能还有相当一部分没有被后训练完全释放。


“比Claude省近一半Token”要谨慎写

这次还有一个传播非常广的说法:

GLM-5.3在自家测试中比Claude同档少用接近一半Token。

从官方资料可以确认的是:

智谱确实专门强调GLM-5.3的Token效率。

其官方文档表示,在相近Token预算下,GLM-5.3在质量、执行速度和使用成本之间实现了更好的平衡。

但目前官方公开的可解析文字中,并没有给出:

“所有Coding任务统一比Claude节省50% Token”

这样的标准结论。

因此更适合写:

“智谱内部Code Bench显示,GLM-5.3在达到相近甚至更高任务完成度时表现出更高Token效率。”

而不是直接写:

“GLM-5.3比Claude省一半Token。”

因为不同项目的:


  • 文件规模

  • Agent Harness

  • Tool Calls

  • Reasoning Effort

  • 输出长度

  • Cache命中

都会改变最终Token消耗。


便宜的关键不仅是单Token价格

Coding Agent真正的成本并不是:

1M Token多少钱

而是:

完成一个任务到底需要多少Token×单Token价格

如果一个模型为了修一个Bug需要:

读代码↓失败↓重试↓再失败↓重复搜索

那么即使每百万Token价格很低,最终任务成本也可能很高。

所以GLM-5.3如果能在更短轨迹、更少冗余输出的情况下完成相同任务,对实际Coding Plan的价值反而比简单降价更大。

目前GLM Coding Plan已经将GLM-5.3列为全套餐支持模型,而且对GLM-5.2和GLM-5.1的旧请求会自动路由至GLM-5.3。官方用于估算Coding工作负载的平均缓存命中率为90.9%,并继续提供非高峰时段50% Credit费率。


GLM-5.3最大的“意外能力”:网络安全

比编程Benchmark更容易引发讨论的,是 Cybersecurity

智谱表示,在长程复杂环境扩大以后,GLM-5.3涌现出了明显更强的:


  • 白盒代码审计;

  • 漏洞发现;

  • 漏洞验证。

能力。

其中在CyberGym测试中:

模型CyberGym
GLM-5.384.5%
Mythos 583.8%
GPT-5.6 Sol83.6%

与此同时,ExploitBench从GLM-5.2的:

24.4%

提高至:

54.4%。

这组数据确实很值得注意。


84.5%到底意味着什么?

CyberGym更偏向:

发现漏洞。

所以84.5%说明GLM-5.3已经能够较强地:


  • 阅读代码;

  • 发现潜在缺陷;

  • 分析安全风险;

  • 完成白盒审计。

但这并不代表它已经具备同等强度的完整攻击能力。

智谱自己也专门强调:

当前优势主要集中在漏洞利用链的前端阶段。

在更深入的漏洞利用以及完整攻防任务中,仍然存在明显提升空间。

简单说就是:

找漏洞★★★★★判断漏洞★★★★★验证漏洞★★★★深入利用仍有明显提升空间

所以你原文里的:

“找漏洞很强,但搞破坏还嫩。”

作为自媒体化表达,其实基本符合官方对能力边界的描述。


为什么权重没有今天同步开放?

这也和网络安全能力有关。

智谱过去GLM系列往往比较积极开放权重。

GLM-5.3这次却选择:

模型先上线↓进行安全评估↓完善Safeguards↓约两周后开放权重

Z.ai官方博客明确表示,模型权重计划在发布两周后提供;其官方账号进一步说明,会在相关安全评估完成并部署适当防护措施后开放。

这意味着这两周并不只是:

“模型文件还没上传完。”

而更像一个主动设置的安全缓冲窗口。

在模型已经表现出较强代码审计和漏洞发现能力的情况下,这个选择并不难理解。


所以“两周后开源”才是真正的大节点

目前GLM-5.3虽然已经上线,但还不能:

下载权重↓本地部署↓量化↓微调↓修改

这些事情要等权重正式发布以后。

此前GLM-5.2开放版本为744B-A40B规格,并提供BF16与FP8权重,同时已经适配SGLang、vLLM、Transformers、KTransformers以及昇腾相关推理框架。

由于GLM-5.3明确沿用GLM-5.2基座,因此等新权重真正发布后,社区最值得关注的会是:


  • GLM-5.3 BF16 / FP8权重;

  • vLLM适配;

  • SGLang适配;

  • 昇腾部署;

  • KTransformers;

  • 社区量化;

  • 私有化部署;

  • Fine-tuning;

  • Agent专项训练。

具体权重格式和部署要求,仍应等待正式仓库更新。


GLM-5.3现在已经可以在哪用?

目前最明确的入口首先是:

ZCode

ZCode官方文档已经全面切换为:

ZCode for GLM-5.3。

ZCode会结合GLM-5.3的1M上下文,让模型在同一个任务中持续读取:


  • 文件;

  • Terminal结果;

  • 浏览器状态;

  • Git状态;

  • 执行权限;

  • 历史工具调用。

并围绕规划、编码、测试和Review持续执行。


GLM Coding Plan

所有Coding Plan套餐目前均支持:


  • GLM-5.3;

  • GLM-5-Turbo;

  • GLM-4.7。

而调用旧GLM-5.2或GLM-5.1的请求,则会自动迁移到GLM-5.3。

所以已经订阅Coding Plan的开发者,不需要等权重开源才能开始使用新模型。


AutoClaw及第三方Agent工具

智谱官方发布内容还表示,GLM-5.3已经进入ZCode、AutoClaw和GLM Coding Plan,并将覆盖TraeWork / TraeCode、扣子、WorkBuddy / CodeBuddy等合作工具。

对于普通用户来说,这一点可能比权重本身更重要。

因为大多数人不会在本地部署一个超大模型。

最终真正体验GLM-5.3的入口,很可能还是:


  • Coding Agent;

  • 办公Agent;

  • OpenClaw类Agent;

  • 开发IDE;

  • 自动化工作台。

独立API目前还没有正式开放

这里也需要特别区分。

Z.ai最新GLM-5.3模型文档目前仍然明确写着:

“The GLM-5.3 API is coming soon.”

因此,现在不能写:

GLM-5.3 API已经全面开放。

目前更准确的是:

Coding Plan和相关产品入口已经可用,独立API即将开放。

同时,Z.ai当前公开API价格页也还没有列出GLM-5.3的按Token API定价。

所以现阶段也不能拿一个未经官方确认的GLM-5.3 API价格,与Claude或GPT直接做成本倍数计算。


新用户还可以免费体验ZCode里的GLM-5.3

ZCode目前对首次使用的新用户提供5天免费体验。

每天提供:


  • GLM-5.3:300万Token;

  • GLM-5-Turbo:200万Token;

合计每天500万Token,但只在首次使用后的5天内每日发放。

对于想直接测试:


  • Goal长任务;

  • Bug修复;

  • 跨文件开发;

  • Browser Use;

  • Subagents;

的用户,这可能是目前最简单的GLM-5.3体验入口之一。


“眼睛”确实还不是这代重点

GLM-5.3目前官方规格依然是:

Input:Text

Output:Text。

也就是说,它不是一款原生视觉多模态旗舰模型。

如果需要:


  • 图片理解;

  • UI截图理解;

  • 视频;

  • 视觉编程;

  • GUI Agent;

智谱目前另有 GLM-5V-Turbo 这条视觉模型产品线。

所以社区说:

“5.3这次主要继续堆Coding和Agent,眼睛没有成为主角。”

这个判断基本成立。

GLM-5.3现在的重点非常明确:

Text + Coding + Agent + Cybersecurity。


“基座没变,是不是挤牙膏?”

这个争议其实可以从两个角度看。

从模型架构角度看

确实没换基座。

甚至智谱自己就公开强调:

Same Base Model as GLM-5.2。

所以如果期待:


  • 更大参数;

  • 新MoE架构;

  • 新Attention;

  • 新视觉编码器;

GLM-5.3确实不是这种更新。

从能力角度看

Terminal-Bench 3.0:

4.6 → 28.3

DeepSWE:

46.2 → 66.9

Agents' Last Exam:

23.8 → 28.5

AutomationBench:

26.2 → 48.2。

所以如果最终任务完成率真的提升了,用户其实并不会特别在意:

参数是不是又多了100B。

从这个角度看,GLM-5.3反而展示了一个很有意思的方向:

基础模型训练完,并不意味着它的能力已经全部开发完。


后训练可能正在变得和预训练一样重要

过去大模型升级非常容易理解:

更多参数+更多数据+更多GPU=下一代模型

现在越来越多厂商开始把竞争重点放在:

更真实的Agent环境+更长执行轨迹+更困难任务+强化学习+工具反馈+最终结果验证

GLM-5.3就是非常典型的例子。

同一个基座,因为看过更复杂、更接近真实高级工程师工作的任务,最终Coding和Agent能力可以出现非常明显的变化。

这也意味着以后评价模型时:

版本号升级 ≠ 一定需要新基座。

后训练本身就可能成为一次非常大的能力版本更新。


对普通用户意味着什么?

不是程序员,也不代表GLM-5.3与你无关。

因为Coding模型进步后,最终会流入大量Agent产品。

例如:

写网页做数据分析处理Excel批量整理文件操作浏览器生成PPT搭建自动化做企业工作流

这些任务背后,本质上都需要模型:


  • 理解复杂要求;

  • 规划;

  • 使用工具;

  • 处理失败;

  • 持续执行。

所以Agent能力越稳定,未来普通人看到的体验就是:

以前:

AI告诉你应该怎么做。

现在:

AI直接把事情做完。

而国内模型持续把价格和Token效率往下压后,最直接的受益者仍然是最终用户。


总结

GLM-5.3这次的更新路线非常明确。

第一,基座没有改变。

智谱明确确认GLM-5.3和GLM-5.2采用相同Base Model,主要提升全部来自Post-Training。

第二,Coding与Agent能力出现明显跃升。

Terminal-Bench 3.0从4.6提高到28.3,超过Kimi K3的17.4;AutomationBench达到48.2,GDPVal-AA v2达到1769。

第三,长程真实工程任务成为训练重点。

部分后训练环境已经接近高级工程师数天的完整工作量,要求模型实际使用代码库、文档、计算和存储系统完成从发现问题到最终交付的完整流程。

第四,网络安全能力明显增强。

CyberGym达到84.5%,略高于Mythos 5和GPT-5.6 Sol;ExploitBench则由24.4%提高至54.4%。不过官方也明确表示,目前优势仍主要集中在漏洞发现与利用链前端,完整深度攻防仍有提升空间。

第五,权重暂时没有同步开放。

官方目标是在发布约两周后开放权重,并利用这段时间继续完成网络安全评估与防护加固。

第六,现在可以先在ZCode、Coding Plan和部分Agent工具里使用,但独立GLM-5.3 API仍是Coming Soon。

所以这次真正值得关注的并不是:

“智谱又发了一个5.3版本。”

而是:

同一个基础模型,仅仅通过把后训练做得更深、更长、更接近真实工作,就能把Coding Agent能力继续往上推这么多。

如果两周后的开放权重也能较完整地保留这些能力,那么那时候才是GLM-5.3真正进入开发者社区大规模测试、本地部署和二次训练的开始。

至于CyberGym 84.5%,确实值得认真看待。

模型越擅长理解真实代码,就越能帮助开发者找到安全问题,同时也越需要更严格的发布流程和使用边界。

能力提升得越快,安全评估也得跟上。

相关链接