推荐Lovart 中文版 - 一站式 AI 设计平台推荐一人企业Vibe Coding社区!热门AI设计工具新品免费AI编程工具 Trae - 智能编码助手Seedance2.5已上线新用户注册即领免费算力
UIED.CN今天偷学哪一招,朋友

“牛来”真身揭晓:智谱 GLM-5.3-Flash 开源,前沿模型价格直接打到 1/40

前几天在 OpenRouter、OpenCode 突然爆火的匿名模型:

image.png

Ox Alpha。

现在终于掉马甲了。

它就是智谱刚刚正式上线并开源的:

GLM-5.3-Flash。

而且这次不只是把旗舰模型做了一个便宜版。

GLM-5.3-Flash 使用了全新的 Base Model 和架构:

320B 总参数

18B 激活参数

1M 上下文

并且成为:

GLM-5 系列首个原生多模态模型。

最夸张的还是价格。

常规定价大约只有 GLM-5.3 的:

1/10。

首发限时 5 折以后进一步来到约:

1/20。

按照智谱官方和 Claude Opus 4.8 的对比口径:

同级前沿智能,价格最低可以做到约 1/40。

Flash 这次是真的开始卷“量大管饱”了。




一、320B 总参数,但只激活 18B

GLM-5.3-Flash 并不是一个传统意义上的“小模型”。

总参数达到:

320B。

但每次处理 Token 时实际只激活:

18B。

相比 GLM-5.3 这种 744B 级旗舰模型,它明显把重点放到了:

智能密度和推理效率。

目标很简单:

不是让更多参数一直工作。

而是:

用尽可能少的计算,把前沿模型能力保留下来。




二、AA Intelligence Index 57 分

GLM-5.3-Flash 在 Artificial Analysis Intelligence Index v4.1.1 中取得:

57 分。

已经进入目前全球前沿模型能力区间。

更重要的是,它在多个 Coding 和 Agent Benchmark 中明显超过上一代 GLM-5.2。

例如:

DeepSWE v1.1:63.4 vs 46.2

AutomationBench:48.8 vs 26.2

Toolathlon Verified:78.4 vs 59.9

在智谱自己的 Z.ai Code Bench 中,GLM-5.3-Flash Max 档也已经接近 Claude Opus 4.8。

所以虽然名字叫:

Flash。

但它并不是过去那种:

“便宜很多,能力也砍一大截”

的产品定位。




三、第一次把视觉直接塞进 GLM-5 Coding Loop

GLM-5.3-Flash 最大的变化之一就是:

原生多模态。

模型从预训练阶段就同时学习:

文本;

图片;

视觉界面;

文档;

图表

等信息。

这对于 Coding Agent 特别重要。

比如 AI 做一个网页。

以前它可能:

代码写完就结束。

现在模型可以继续:

写代码
↓
打开网页
↓
自己看渲染结果
↓
发现布局不对
↓
修改代码
↓
重新检查

视觉开始真正进入:

Coding Loop。

这对于前端开发、小游戏、3D 场景、浏览器自动化都会比较有用。




四、这其实就是之前爆火的 Ox Alpha

GLM-5.3-Flash 正式发布之前,智谱并没有直接公布身份。

而是把它包装成匿名模型:

Ox Alpha。

放到 OpenRouter 和 OpenCode 上给真实开发者盲测。

结果上线后很快冲到平台调用榜头部,大量开发者拿它跑:

Coding Agent;

代码仓库;

工具调用;

长程任务。

直到正式发布,智谱才认领:

Ox Alpha = GLM-5.3-Flash。

也就是说,之前大家疯狂猜:

Gemini?

微软 MAI?

GLM?

现在终于有答案了。

还真是 GLM。




五、混合注意力架构才是这次省钱的核心

GLM-5.3-Flash 这次最大的架构变化,是:

Sparse Attention + Linear Attention

稀疏注意力与线性注意力混合。

线性注意力负责处理大量局部信息。

稀疏注意力则负责从超长上下文里找到真正需要关注的全局内容。

两者组合以后,可以明显降低长上下文的计算量。

与 GLM-5.3 相比:

Attention 计算量降低约 3 倍。

KV Cache 规模降低约 4.4 倍。

这在 1M Context 下非常重要。

因为 Agent 真正跑长任务时,贵的不只是生成 Token。

还有:

整个上下文到底有多重。




六、价格真的砍得很猛

Z.ai 当前 GLM-5.3-Flash 标准 API 价格为:

输入:$0.15 / 1M Tokens

缓存输入:$0.03 / 1M Tokens

输出:$0.50 / 1M Tokens

首发期间还有:

5 折。

折后变成:

输入:$0.075 / 1M Tokens

缓存输入:$0.015 / 1M Tokens

输出:$0.25 / 1M Tokens

优惠持续到:

2026 年 9 月 9 日 24:00。

相比 GLM-5.3:

常规价格大约降到:

1/10。

优惠期则接近:

1/20。

而按照智谱官方与 Claude Opus 4.8 的综合对比口径:

约为 1/40。

这才是这次 Flash 最狠的地方。

不是单纯做个小模型。

而是:

把旗舰级能力往低价区间硬塞。




七、1M 上下文,Agent 更适合放开跑

GLM-5.3-Flash 同样支持:

1M Token Context。

所以它特别适合:

大型代码仓库;

复杂研究;

大量文档;

长程 Coding Agent;

连续工具调用。

以前 Agent 最大的问题之一就是:

任务越长越烧钱。

现在如果模型单价降低一个数量级,很多以前舍不得跑的:

几百轮工具调用;

大型 Repo 分析;

批量办公;

自动化 Research

都会变得更现实。




八、不只是 Coding,办公也直接做完整交付

GLM-5.3-Flash 现在还强化了专业办公任务。

它可以围绕:

PDF;

Word;

Excel;

PPT;

图表;

网页资料

继续完成多步骤任务。

比如:

阅读这些行业报告和销售表格,分析三项主要风险,再制作一份管理层 PPT。

Agent 可以继续完成:

研究;

数据处理;

模型分析;

视觉检查;

文件制作。

最后直接交付:

PPTX;

PDF;

DOCX;

XLSX。

再加上原生视觉以后,它甚至可以自己查看:

PPT 是否溢出;

图表是否清楚;

图片有没有裁错;

页面对齐是否异常。

这比普通“帮我写个 PPT 大纲”又往前走了一步。




九、模型权重已经开放

GLM-5.3-Flash 不是只有 API。

模型权重已经正式开放。

目前提供:

FP8;

BF16

版本。

可以通过:

Hugging Face;

ModelScope

获取。

模型页面采用:

MIT License。

同时支持包括:

SGLang;

vLLM;

Transformers;

KTransformers;

Unsloth

等推理和部署方案。

所以开发者可以继续:

本地部署;

量化;

研究架构;

接自己的 Agent Harness。

这也是“开源”真正有意思的部分。




十、现在连 GLM Coding Plan 都给了 3 倍额度

GLM-5.3-Flash 目前也已经全面进入:

GLM Coding Plan。

同一份套餐下,它能够获得大约:

GLM-5.3 的 3 倍可用额度。

而在算力闲时和周末:

积分消耗还会进一步降低。

对于 Claude Code、ZCode、OpenCode 这类 Coding Agent 的重度用户来说,这种模型可能比旗舰模型更适合:

长期常驻。

普通任务跑 Flash。

真的碰到特别难的问题,再切旗舰。




结语

GLM-5.3-Flash 这次最值得记住的是:

320B 总参数。

18B 激活参数。

1M 上下文。

原生多模态。

AA Intelligence Index 57 分。

稀疏注意力 + 线性注意力混合架构。

常规价格约为 GLM-5.3:

1/10。

首发折扣:

约 1/20。

按智谱官方和 Opus 4.8 的对比口径:

约 1/40。

更有意思的是:

它就是前几天在 OpenRouter 和 OpenCode 上爆火的匿名模型:

Ox Alpha。

这也说明现在大模型竞争的方向已经很明显了。

以前大家卷:

谁最聪明。

现在开始继续卷:

同样聪明,谁更便宜。

Agent 时代一天跑掉几百万甚至上亿 Token 并不稀奇。

所以最终真正能被大量使用的模型,不一定只是 Benchmark 第一。

还得:

跑得动、跑得快、跑得起。

GLM-5.3-Flash 这次瞄准的,就是这个位置。




相关链接

Z.ai 在线体验

https://chat.z.ai/

GLM-5.3-Flash 官方介绍

https://z.ai/blog/glm-5.3-flash

GLM-5.3-Flash 官方开发文档

https://docs.z.ai/guides/vlm/glm-5.3-flash

Z.ai API 价格

https://docs.z.ai/guides/overview/pricing

GLM-5 GitHub 开源仓库

https://github.com/zai-org/GLM-5

GLM-5.3-Flash Hugging Face

https://huggingface.co/zai-org/GLM-5.3-Flash

ZCode

https://zcode.z.ai/

GLM Coding Plan

https://z.ai/subscribe








标签

评论 0

最新评论

登录后发布评论并参与互动。

暂无评论,欢迎抢沙发。

推荐阅读

查看更多