2026年8月14日,智谱/Z.ai正式发布新一代旗舰模型 GLM-5.3。
这一代最有意思的地方,并不是参数继续扩大。

恰恰相反——GLM-5.3直接沿用了GLM-5.2的Base Model,主要能力提升来自Post-Training后训练。
智谱官方明确表示,GLM-5.3与GLM-5.2使用相同基座,但在自研Z.ai Code Bench上的编程表现提升约50%,并在Terminal-Bench 3.0、Agents' Last Exam等Coding与Agent测试中刷新了开源模型成绩。模型继续提供1M Token上下文,最大输出达到128K。
换句话说,这次不是:
更大的模型+更多参数=更强能力而更接近:
同一个Base Model+更大规模真实任务后训练+更长执行轨迹+更复杂Agent环境=GLM-5.3这也使GLM-5.3成为一个很值得观察的案例:
一个已经训练完成的基础模型,到底还能通过后训练继续挖出多少能力?
GLM-5.3核心规格
| 项目 | GLM-5.3 |
|---|---|
| 产品定位 | 旗舰基础模型 |
| 基座 | 与GLM-5.2相同 |
| 主要升级方式 | Post-Training |
| 输入 | Text |
| 输出 | Text |
| 上下文长度 | 1M Token |
| 最大输出 | 128K Token |
| Thinking | 支持 |
| Streaming | 支持 |
| Function Call | 支持 |
| Context Cache | 支持 |
| Structured Output | 支持 |
| MCP | 支持 |
| API | Coming Soon |
| Coding Plan | 已开放 |
| ZCode | 已支持 |
| 模型权重 | 计划发布后约两周开放 |
以上规格来自Z.ai最新GLM-5.3官方文档。
需要特别注意:
现在上线的是模型服务,并不是模型权重同步开源。
Z.ai官方表示,GLM-5.3权重计划在模型发布大约两周后公开;同时其官方账号进一步说明,公开前还会完成相关安全评估并部署适当的防护措施。
按照8月14日发布时间推算,如果安全评估按计划完成,时间大致会落在 8月28日前后。这是根据官方“两周”计划推算,并不是已经公布的精确权重发布日期。
Terminal-Bench 3.0:从4.6直接冲到28.3
这次最显眼的升级之一,就是Terminal-Bench 3.0。
GLM-5.2此前只有:
4.6分。
GLM-5.3直接提高到了:
28.3分。
智谱公布的对比图显示,同一组测试中:
| 模型 | Terminal-Bench 3.0 |
|---|---|
| GPT-5.6 Sol | 34.6 |
| Fable 5 | 33.7 |
| GLM-5.3 | 28.3 |
| Kimi K3 | 17.4 |
| GLM-5.2 | 4.6 |
也就是说,GLM-5.3相较自己的上一代不是小修小补。
从4.6到28.3,提升超过5倍。
同时也明显超过了图表中Kimi K3的17.4。
不过,28.3目前仍低于Fable 5和GPT-5.6 Sol,所以更准确的表述是:
GLM-5.3显著缩小了国产开放模型与闭源前沿模型在Terminal Agent任务上的差距。
而不是“已经全面超过Claude或GPT”。
不只是Terminal-Bench,其他Agent测试也一起涨了
智谱公布的六组核心测试中,GLM-5.3的成绩为:
| Benchmark | GLM-5.3 | GLM-5.2 | Kimi K3 | Fable 5 | GPT-5.6 Sol |
|---|---|---|---|---|---|
| Terminal-Bench 3.0 | 28.3 | 4.6 | 17.4 | 33.7 | 34.6 |
| DeepSWE | 66.9 | 46.2 | 67.5 | 69.7 | 72.7 |
| Agents' Last Exam | 28.5 | 23.8 | 27.6 | 23.8 | 28.6 |
| AutomationBench | 48.2 | 26.2 | 46.7 | 46.2 | 45.8 |
| HLE w/ Tools | 62.5 | 54.7 | 59.8 | 63.9 | 64.5 |
| GDPVal-AA v2 | 1769 | 1508 | 1682 | 1743 | 1730 |
这里其实比Terminal-Bench单项更值得看。
因为GLM-5.3并不是每一项都第一。
例如:
DeepSWE仍低于Kimi K3、Fable 5和GPT-5.6 Sol;
HLE w/ Tools距离Fable 5和GPT-5.6 Sol还有差距;
Terminal-Bench 3.0同样没有超过最强闭源模型。
但在AutomationBench和GDPVal-AA v2上,GLM-5.3反而超过了图表中的几个闭源竞争模型。
这说明它这次的提升更偏向:
实际执行任务、Agent工作流和复杂工程交付。
自研Z.ai Code Bench提升50%
智谱官方给出的另一个核心指标来自内部 Z.ai Code Bench。
GLM-5.3相较GLM-5.2:
编程表现提高约50%。
这里的测试重点不是传统:
给一道算法题↓输出代码↓检查答案而更加接近真实工程:
理解复杂需求↓阅读项目↓寻找相关代码↓制定方案↓跨文件修改↓运行工具↓测试↓发现失败↓重新分析↓继续修改↓完成交付这也是为什么这一代的训练方式值得单独讲。
基座完全没换,究竟是怎么涨出来的?
官方文档直接明确:
GLM-5.3使用与GLM-5.2相同的Base Model,所有提升均来自Post-Training。
这其实回应了“是不是挤牙膏”的争议。
从参数角度看:
确实没有换新的Base。
但从后训练角度看,智谱这次做的不是简单增加几批Coding题。
训练环境开始从孤立代码问题扩展到完整专家工作流程:
发现问题↓分析方案↓执行↓验证↓最终交付官方甚至表示,其中部分训练任务的工作量,相当于一名资深工程师连续工作数天;模型需要使用真实计算集群、存储系统、内部文档和代码库完成整个任务。
这和传统SFT最大的区别是:
过去训练模型:
写这个函数。
现在训练Agent:
把这个项目的问题解决掉。
为什么这种训练方式对Coding Agent特别重要?
软件工程本身就不是一次回答。
例如一个Bug可能经历:
读取报错↓搜索代码↓找到调用关系↓形成假设↓修改↓运行↓测试失败↓假设错误↓重新搜索↓修改第二处↓重新测试真正强的Coding Agent,需要能够在很长时间里持续:
保持目标;
管理上下文;
读取工具反馈;
判断失败原因;
修改自己的策略;
再次执行。
GLM-5.3的后训练就是越来越围绕这种完整轨迹,而不是只提高第一轮答案质量。
所以“基座没换”不一定意味着:
没什么升级。
它反而证明了一个问题:
GLM-5.2的基础能力可能还有相当一部分没有被后训练完全释放。
“比Claude省近一半Token”要谨慎写
这次还有一个传播非常广的说法:
GLM-5.3在自家测试中比Claude同档少用接近一半Token。
从官方资料可以确认的是:
智谱确实专门强调GLM-5.3的Token效率。
其官方文档表示,在相近Token预算下,GLM-5.3在质量、执行速度和使用成本之间实现了更好的平衡。
但目前官方公开的可解析文字中,并没有给出:
“所有Coding任务统一比Claude节省50% Token”
这样的标准结论。
因此更适合写:
“智谱内部Code Bench显示,GLM-5.3在达到相近甚至更高任务完成度时表现出更高Token效率。”
而不是直接写:
“GLM-5.3比Claude省一半Token。”
因为不同项目的:
文件规模
Agent Harness
Tool Calls
Reasoning Effort
输出长度
Cache命中
都会改变最终Token消耗。
便宜的关键不仅是单Token价格
Coding Agent真正的成本并不是:
1M Token多少钱而是:
完成一个任务到底需要多少Token×单Token价格如果一个模型为了修一个Bug需要:
读代码↓失败↓重试↓再失败↓重复搜索那么即使每百万Token价格很低,最终任务成本也可能很高。
所以GLM-5.3如果能在更短轨迹、更少冗余输出的情况下完成相同任务,对实际Coding Plan的价值反而比简单降价更大。
目前GLM Coding Plan已经将GLM-5.3列为全套餐支持模型,而且对GLM-5.2和GLM-5.1的旧请求会自动路由至GLM-5.3。官方用于估算Coding工作负载的平均缓存命中率为90.9%,并继续提供非高峰时段50% Credit费率。
GLM-5.3最大的“意外能力”:网络安全
比编程Benchmark更容易引发讨论的,是 Cybersecurity。
智谱表示,在长程复杂环境扩大以后,GLM-5.3涌现出了明显更强的:
白盒代码审计;
漏洞发现;
漏洞验证。
能力。
其中在CyberGym测试中:
| 模型 | CyberGym |
|---|---|
| GLM-5.3 | 84.5% |
| Mythos 5 | 83.8% |
| GPT-5.6 Sol | 83.6% |
与此同时,ExploitBench从GLM-5.2的:
24.4%
提高至:
54.4%。
这组数据确实很值得注意。
84.5%到底意味着什么?
CyberGym更偏向:
发现漏洞。
所以84.5%说明GLM-5.3已经能够较强地:
阅读代码;
发现潜在缺陷;
分析安全风险;
完成白盒审计。
但这并不代表它已经具备同等强度的完整攻击能力。
智谱自己也专门强调:
当前优势主要集中在漏洞利用链的前端阶段。
在更深入的漏洞利用以及完整攻防任务中,仍然存在明显提升空间。
简单说就是:
找漏洞★★★★★判断漏洞★★★★★验证漏洞★★★★深入利用仍有明显提升空间所以你原文里的:
“找漏洞很强,但搞破坏还嫩。”
作为自媒体化表达,其实基本符合官方对能力边界的描述。
为什么权重没有今天同步开放?
这也和网络安全能力有关。
智谱过去GLM系列往往比较积极开放权重。
GLM-5.3这次却选择:
模型先上线↓进行安全评估↓完善Safeguards↓约两周后开放权重Z.ai官方博客明确表示,模型权重计划在发布两周后提供;其官方账号进一步说明,会在相关安全评估完成并部署适当防护措施后开放。
这意味着这两周并不只是:
“模型文件还没上传完。”
而更像一个主动设置的安全缓冲窗口。
在模型已经表现出较强代码审计和漏洞发现能力的情况下,这个选择并不难理解。
所以“两周后开源”才是真正的大节点
目前GLM-5.3虽然已经上线,但还不能:
下载权重↓本地部署↓量化↓微调↓修改这些事情要等权重正式发布以后。
此前GLM-5.2开放版本为744B-A40B规格,并提供BF16与FP8权重,同时已经适配SGLang、vLLM、Transformers、KTransformers以及昇腾相关推理框架。
由于GLM-5.3明确沿用GLM-5.2基座,因此等新权重真正发布后,社区最值得关注的会是:
GLM-5.3 BF16 / FP8权重;
vLLM适配;
SGLang适配;
昇腾部署;
KTransformers;
社区量化;
私有化部署;
Fine-tuning;
Agent专项训练。
具体权重格式和部署要求,仍应等待正式仓库更新。
GLM-5.3现在已经可以在哪用?
目前最明确的入口首先是:
ZCode
ZCode官方文档已经全面切换为:
ZCode for GLM-5.3。
ZCode会结合GLM-5.3的1M上下文,让模型在同一个任务中持续读取:
文件;
Terminal结果;
浏览器状态;
Git状态;
执行权限;
历史工具调用。
并围绕规划、编码、测试和Review持续执行。
GLM Coding Plan
所有Coding Plan套餐目前均支持:
GLM-5.3;
GLM-5-Turbo;
GLM-4.7。
而调用旧GLM-5.2或GLM-5.1的请求,则会自动迁移到GLM-5.3。
所以已经订阅Coding Plan的开发者,不需要等权重开源才能开始使用新模型。
AutoClaw及第三方Agent工具
智谱官方发布内容还表示,GLM-5.3已经进入ZCode、AutoClaw和GLM Coding Plan,并将覆盖TraeWork / TraeCode、扣子、WorkBuddy / CodeBuddy等合作工具。
对于普通用户来说,这一点可能比权重本身更重要。
因为大多数人不会在本地部署一个超大模型。
最终真正体验GLM-5.3的入口,很可能还是:
Coding Agent;
办公Agent;
OpenClaw类Agent;
开发IDE;
自动化工作台。
独立API目前还没有正式开放
这里也需要特别区分。
Z.ai最新GLM-5.3模型文档目前仍然明确写着:
“The GLM-5.3 API is coming soon.”
因此,现在不能写:
GLM-5.3 API已经全面开放。
目前更准确的是:
Coding Plan和相关产品入口已经可用,独立API即将开放。
同时,Z.ai当前公开API价格页也还没有列出GLM-5.3的按Token API定价。
所以现阶段也不能拿一个未经官方确认的GLM-5.3 API价格,与Claude或GPT直接做成本倍数计算。
新用户还可以免费体验ZCode里的GLM-5.3
ZCode目前对首次使用的新用户提供5天免费体验。
每天提供:
GLM-5.3:300万Token;
GLM-5-Turbo:200万Token;
合计每天500万Token,但只在首次使用后的5天内每日发放。
对于想直接测试:
Goal长任务;
Bug修复;
跨文件开发;
Browser Use;
Subagents;
的用户,这可能是目前最简单的GLM-5.3体验入口之一。
“眼睛”确实还不是这代重点
GLM-5.3目前官方规格依然是:
Input:Text
Output:Text。
也就是说,它不是一款原生视觉多模态旗舰模型。
如果需要:
图片理解;
UI截图理解;
视频;
视觉编程;
GUI Agent;
智谱目前另有 GLM-5V-Turbo 这条视觉模型产品线。
所以社区说:
“5.3这次主要继续堆Coding和Agent,眼睛没有成为主角。”
这个判断基本成立。
GLM-5.3现在的重点非常明确:
Text + Coding + Agent + Cybersecurity。
“基座没变,是不是挤牙膏?”
这个争议其实可以从两个角度看。
从模型架构角度看
确实没换基座。
甚至智谱自己就公开强调:
Same Base Model as GLM-5.2。
所以如果期待:
更大参数;
新MoE架构;
新Attention;
新视觉编码器;
GLM-5.3确实不是这种更新。
从能力角度看
Terminal-Bench 3.0:
4.6 → 28.3
DeepSWE:
46.2 → 66.9
Agents' Last Exam:
23.8 → 28.5
AutomationBench:
26.2 → 48.2。
所以如果最终任务完成率真的提升了,用户其实并不会特别在意:
参数是不是又多了100B。
从这个角度看,GLM-5.3反而展示了一个很有意思的方向:
基础模型训练完,并不意味着它的能力已经全部开发完。
后训练可能正在变得和预训练一样重要
过去大模型升级非常容易理解:
更多参数+更多数据+更多GPU=下一代模型现在越来越多厂商开始把竞争重点放在:
更真实的Agent环境+更长执行轨迹+更困难任务+强化学习+工具反馈+最终结果验证GLM-5.3就是非常典型的例子。
同一个基座,因为看过更复杂、更接近真实高级工程师工作的任务,最终Coding和Agent能力可以出现非常明显的变化。
这也意味着以后评价模型时:
版本号升级 ≠ 一定需要新基座。
后训练本身就可能成为一次非常大的能力版本更新。
对普通用户意味着什么?
不是程序员,也不代表GLM-5.3与你无关。
因为Coding模型进步后,最终会流入大量Agent产品。
例如:
写网页做数据分析处理Excel批量整理文件操作浏览器生成PPT搭建自动化做企业工作流这些任务背后,本质上都需要模型:
理解复杂要求;
规划;
使用工具;
处理失败;
持续执行。
所以Agent能力越稳定,未来普通人看到的体验就是:
以前:
AI告诉你应该怎么做。
现在:
AI直接把事情做完。
而国内模型持续把价格和Token效率往下压后,最直接的受益者仍然是最终用户。
总结
GLM-5.3这次的更新路线非常明确。
第一,基座没有改变。
智谱明确确认GLM-5.3和GLM-5.2采用相同Base Model,主要提升全部来自Post-Training。
第二,Coding与Agent能力出现明显跃升。
Terminal-Bench 3.0从4.6提高到28.3,超过Kimi K3的17.4;AutomationBench达到48.2,GDPVal-AA v2达到1769。
第三,长程真实工程任务成为训练重点。
部分后训练环境已经接近高级工程师数天的完整工作量,要求模型实际使用代码库、文档、计算和存储系统完成从发现问题到最终交付的完整流程。
第四,网络安全能力明显增强。
CyberGym达到84.5%,略高于Mythos 5和GPT-5.6 Sol;ExploitBench则由24.4%提高至54.4%。不过官方也明确表示,目前优势仍主要集中在漏洞发现与利用链前端,完整深度攻防仍有提升空间。
第五,权重暂时没有同步开放。
官方目标是在发布约两周后开放权重,并利用这段时间继续完成网络安全评估与防护加固。
第六,现在可以先在ZCode、Coding Plan和部分Agent工具里使用,但独立GLM-5.3 API仍是Coming Soon。
所以这次真正值得关注的并不是:
“智谱又发了一个5.3版本。”
而是:
同一个基础模型,仅仅通过把后训练做得更深、更长、更接近真实工作,就能把Coding Agent能力继续往上推这么多。
如果两周后的开放权重也能较完整地保留这些能力,那么那时候才是GLM-5.3真正进入开发者社区大规模测试、本地部署和二次训练的开始。
至于CyberGym 84.5%,确实值得认真看待。
模型越擅长理解真实代码,就越能帮助开发者找到安全问题,同时也越需要更严格的发布流程和使用边界。
能力提升得越快,安全评估也得跟上。










评论区 (0)
最新评论登录后发布评论并参与互动。
暂无评论,欢迎抢沙发。