541/8
“牛来”模型身份揭晓,Qwen3.8-Flash-Next也来了。
前几天大家一直在猜的“牛来”,终于揭晓了。
Ox Alpha 就是智谱的 GLM-5.3-Flash。
320B 总参数、18B 激活、1M 上下文,还是 GLM-5 系列首个原生多模态模型。
更直接的是价格:目前折后输入 $0.075 / 1M tokens,输出 $0.25。
同一天,Qwen 也放出了 Qwen3.8-Flash-Next。
这个名字很容易看晕,简单理解就是:它还是 Qwen3.8,但已经提前用上了 Qwen4 的早期架构。
125B 主模型,每个 Token 只激活 6B,训练成本只有 Qwen3.7-Plus 的约 1/9,Coding 和 Office 的几项成绩反而更高。
我把两家的 Benchmark 和现在几个主流性价比模型的 API 价格一起整理看了一下。
看完以后,我觉得这一波 Flash 模型的发布最值得关注的已经不只是“快”。
现在 Coding Agent、办公 Agent 一跑就是十几或者几十分钟,反复读文件、调用工具、生成内容,Token 很容易不断往上涨。
只聊天用,花费的 Token 费用差几块钱可能没什么感觉。
但 Agent 真正跑起来以后,能力接近的模型,几倍的单价差距最后就是几倍的费用差距。
所以 GLM 和 Qwen 这波新模型发布,我个人更关注一个很实际的问题:
哪个厂家能把“够用”的 Agent 能力,做到更低的价格。也就是性价比更高,我更愿意使用。










评论 0
最新评论登录后发布评论并参与互动。
暂无评论,欢迎抢沙发。