“牛来”真身揭晓:智谱 GLM-5.3-Flash 开源,前沿模型价格直接打到 1/40
前几天在 OpenRouter、OpenCode 突然爆火的匿名模型:

Ox Alpha。
现在终于掉马甲了。
它就是智谱刚刚正式上线并开源的:
GLM-5.3-Flash。
而且这次不只是把旗舰模型做了一个便宜版。
GLM-5.3-Flash 使用了全新的 Base Model 和架构:
320B 总参数
18B 激活参数
1M 上下文
并且成为:
GLM-5 系列首个原生多模态模型。
最夸张的还是价格。
常规定价大约只有 GLM-5.3 的:
1/10。
首发限时 5 折以后进一步来到约:
1/20。
按照智谱官方和 Claude Opus 4.8 的对比口径:
同级前沿智能,价格最低可以做到约 1/40。
Flash 这次是真的开始卷“量大管饱”了。
一、320B 总参数,但只激活 18B
GLM-5.3-Flash 并不是一个传统意义上的“小模型”。
总参数达到:
320B。
但每次处理 Token 时实际只激活:
18B。
相比 GLM-5.3 这种 744B 级旗舰模型,它明显把重点放到了:
智能密度和推理效率。
目标很简单:
不是让更多参数一直工作。
而是:
用尽可能少的计算,把前沿模型能力保留下来。
二、AA Intelligence Index 57 分
GLM-5.3-Flash 在 Artificial Analysis Intelligence Index v4.1.1 中取得:
57 分。
已经进入目前全球前沿模型能力区间。
更重要的是,它在多个 Coding 和 Agent Benchmark 中明显超过上一代 GLM-5.2。
例如:
DeepSWE v1.1:63.4 vs 46.2
AutomationBench:48.8 vs 26.2
Toolathlon Verified:78.4 vs 59.9
在智谱自己的 Z.ai Code Bench 中,GLM-5.3-Flash Max 档也已经接近 Claude Opus 4.8。
所以虽然名字叫:
Flash。
但它并不是过去那种:
“便宜很多,能力也砍一大截”
的产品定位。
三、第一次把视觉直接塞进 GLM-5 Coding Loop
GLM-5.3-Flash 最大的变化之一就是:
原生多模态。
模型从预训练阶段就同时学习:
文本;
图片;
视觉界面;
文档;
图表
等信息。
这对于 Coding Agent 特别重要。
比如 AI 做一个网页。
以前它可能:
代码写完就结束。
现在模型可以继续:
写代码
↓
打开网页
↓
自己看渲染结果
↓
发现布局不对
↓
修改代码
↓
重新检查视觉开始真正进入:
Coding Loop。
这对于前端开发、小游戏、3D 场景、浏览器自动化都会比较有用。
四、这其实就是之前爆火的 Ox Alpha
GLM-5.3-Flash 正式发布之前,智谱并没有直接公布身份。
而是把它包装成匿名模型:
Ox Alpha。
放到 OpenRouter 和 OpenCode 上给真实开发者盲测。
结果上线后很快冲到平台调用榜头部,大量开发者拿它跑:
Coding Agent;
代码仓库;
工具调用;
长程任务。
直到正式发布,智谱才认领:
Ox Alpha = GLM-5.3-Flash。
也就是说,之前大家疯狂猜:
Gemini?
微软 MAI?
GLM?
现在终于有答案了。
还真是 GLM。
五、混合注意力架构才是这次省钱的核心
GLM-5.3-Flash 这次最大的架构变化,是:
Sparse Attention + Linear Attention
稀疏注意力与线性注意力混合。
线性注意力负责处理大量局部信息。
稀疏注意力则负责从超长上下文里找到真正需要关注的全局内容。
两者组合以后,可以明显降低长上下文的计算量。
与 GLM-5.3 相比:
Attention 计算量降低约 3 倍。
KV Cache 规模降低约 4.4 倍。
这在 1M Context 下非常重要。
因为 Agent 真正跑长任务时,贵的不只是生成 Token。
还有:
整个上下文到底有多重。
六、价格真的砍得很猛
Z.ai 当前 GLM-5.3-Flash 标准 API 价格为:
输入:$0.15 / 1M Tokens
缓存输入:$0.03 / 1M Tokens
输出:$0.50 / 1M Tokens
首发期间还有:
5 折。
折后变成:
输入:$0.075 / 1M Tokens
缓存输入:$0.015 / 1M Tokens
输出:$0.25 / 1M Tokens
优惠持续到:
2026 年 9 月 9 日 24:00。
相比 GLM-5.3:
常规价格大约降到:
1/10。
优惠期则接近:
1/20。
而按照智谱官方与 Claude Opus 4.8 的综合对比口径:
约为 1/40。
这才是这次 Flash 最狠的地方。
不是单纯做个小模型。
而是:
把旗舰级能力往低价区间硬塞。
七、1M 上下文,Agent 更适合放开跑
GLM-5.3-Flash 同样支持:
1M Token Context。
所以它特别适合:
大型代码仓库;
复杂研究;
大量文档;
长程 Coding Agent;
连续工具调用。
以前 Agent 最大的问题之一就是:
任务越长越烧钱。
现在如果模型单价降低一个数量级,很多以前舍不得跑的:
几百轮工具调用;
大型 Repo 分析;
批量办公;
自动化 Research
都会变得更现实。
八、不只是 Coding,办公也直接做完整交付
GLM-5.3-Flash 现在还强化了专业办公任务。
它可以围绕:
PDF;
Word;
Excel;
PPT;
图表;
网页资料
继续完成多步骤任务。
比如:
阅读这些行业报告和销售表格,分析三项主要风险,再制作一份管理层 PPT。
Agent 可以继续完成:
研究;
数据处理;
模型分析;
视觉检查;
文件制作。
最后直接交付:
PPTX;
PDF;
DOCX;
XLSX。
再加上原生视觉以后,它甚至可以自己查看:
PPT 是否溢出;
图表是否清楚;
图片有没有裁错;
页面对齐是否异常。
这比普通“帮我写个 PPT 大纲”又往前走了一步。
九、模型权重已经开放
GLM-5.3-Flash 不是只有 API。
模型权重已经正式开放。
目前提供:
FP8;
BF16
版本。
可以通过:
Hugging Face;
ModelScope
获取。
模型页面采用:
MIT License。
同时支持包括:
SGLang;
vLLM;
Transformers;
KTransformers;
Unsloth
等推理和部署方案。
所以开发者可以继续:
本地部署;
量化;
研究架构;
接自己的 Agent Harness。
这也是“开源”真正有意思的部分。
十、现在连 GLM Coding Plan 都给了 3 倍额度
GLM-5.3-Flash 目前也已经全面进入:
GLM Coding Plan。
同一份套餐下,它能够获得大约:
GLM-5.3 的 3 倍可用额度。
而在算力闲时和周末:
积分消耗还会进一步降低。
对于 Claude Code、ZCode、OpenCode 这类 Coding Agent 的重度用户来说,这种模型可能比旗舰模型更适合:
长期常驻。
普通任务跑 Flash。
真的碰到特别难的问题,再切旗舰。
结语
GLM-5.3-Flash 这次最值得记住的是:
320B 总参数。
18B 激活参数。
1M 上下文。
原生多模态。
AA Intelligence Index 57 分。
稀疏注意力 + 线性注意力混合架构。
常规价格约为 GLM-5.3:
1/10。
首发折扣:
约 1/20。
按智谱官方和 Opus 4.8 的对比口径:
约 1/40。
更有意思的是:
它就是前几天在 OpenRouter 和 OpenCode 上爆火的匿名模型:
Ox Alpha。
这也说明现在大模型竞争的方向已经很明显了。
以前大家卷:
谁最聪明。
现在开始继续卷:
同样聪明,谁更便宜。
Agent 时代一天跑掉几百万甚至上亿 Token 并不稀奇。
所以最终真正能被大量使用的模型,不一定只是 Benchmark 第一。
还得:
跑得动、跑得快、跑得起。
GLM-5.3-Flash 这次瞄准的,就是这个位置。
相关链接
Z.ai 在线体验
GLM-5.3-Flash 官方介绍
https://z.ai/blog/glm-5.3-flash
GLM-5.3-Flash 官方开发文档
https://docs.z.ai/guides/vlm/glm-5.3-flash
Z.ai API 价格
https://docs.z.ai/guides/overview/pricing
GLM-5 GitHub 开源仓库
https://github.com/zai-org/GLM-5
GLM-5.3-Flash Hugging Face
https://huggingface.co/zai-org/GLM-5.3-Flash
ZCode
GLM Coding Plan
标签






评论 0
最新评论登录后发布评论并参与互动。
暂无评论,欢迎抢沙发。