千问办公进入“量大管饱”模式:Qwen3.8-Flash 上线,Token 平均少烧 75%

Agent 现在越来越能干,但一个现实问题也越来越明显:
太烧 Token 了。
做一次聊天可能只需要几千 Token。
但真正让 Agent 去:
查资料、读文件、规划任务、调用工具、修改内容、反复检查……
一次复杂任务很容易把 Token 消耗拉到普通聊天的数倍甚至数十倍。
千问办公这次干脆从底层换了一套“省油发动机”。
8 月 26 日晚,千问办公首发上线 Qwen3.8-Flash,并同步推出全新的:
标准模式。
以后模型供给会进一步简化成:
标准模式 + 高级模式。
官方给出的定位很直接:
95% 的日常办公任务交给标准模式,剩下约 5% 的复杂任务再使用高级模式。
一、Qwen3.8-Flash 不是简单的“小模型”
虽然名字叫 Flash,但它并不是单纯为了追求速度而大幅牺牲能力。
Qwen3.8-Flash 采用一套全新架构,也是:
Qwen4 架构的提前预览。
模型主体总参数:
125B。
但每个 Token 实际只激活:
6B 参数。
另外还加入约 51B 的 N-gram Embedding 参数,在尽量少增加实际计算量的情况下继续扩展模型容量。
简单理解就是:
模型知道得更多,但每次真正干活时不用把所有参数都跑一遍。
这也是它能够同时兼顾:
性能、速度和成本
的重要原因。
二、官方评测里,部分编程和办公任务已经超过 Claude Opus 4.6
“Flash”最大的惊喜其实不是便宜。
而是能力并没有掉到传统小模型的水平。
官方公布的测试中:
SWE-bench Pro:
Qwen3.8-Flash:62.5
Claude Opus 4.6:53.4
长程办公任务 CoWorkBench:
Qwen3.8-Flash:73.9
Claude Opus 4.6:68.2
多语言软件工程:
81.0 vs 77.5。
所以更准确的说法应该是:
Qwen3.8-Flash 在多个 Coding 和办公 Agent Benchmark 中已经超过 Claude Opus 4.6。
而不是笼统地说所有能力全面超过。
三、1M 上下文,Flash 也开始跑长任务
Qwen3.8-Flash 原生服务版本支持:
1,000,000 Token 上下文。
最大输出:
128K Token。
同时支持:
文字;
图片;
视频
多模态理解。
这对办公 Agent 很重要。
因为真实任务里很容易同时出现:
几十份文档;
大型 Excel;
网页资料;
历史聊天;
长报告;
截图;
视频。
上下文足够长以后,Agent 才更适合连续做:
长文档分析;
大型代码库;
深度研究;
复杂办公自动化。
四、真正的重点其实是:模型和 Agent 一起优化
千问办公这次并不是简单:
把底层模型从 A 换成 Qwen3.8-Flash。
千问模型团队还专门为办公场景做了一版 Qwen3.8-Flash。
重点优化:
多步规划
工具选择
上下文压缩
这些 Agent 高频任务。
同时,千问办公又在推理侧和 Harness 架构继续优化。
整个逻辑其实就是:
Qwen3.8-Flash
+
办公场景专项训练
+
推理优化
+
Harness
+
Agent工作流
=
千问办公标准模式这也是现在 Agent 竞争越来越明显的一个趋势:
模型强还不够,模型和 Harness 得一起调。
五、真实办公测试:速度翻倍,Token平均减少75%
这次千问办公对外披露的一组数据比较直观。
在真实办公场景测试中:
单任务 Token 生成速度约提升 100%。
同时:
Token 消耗平均减少约 75%。
也就是以前一个任务可能要消耗:
100 份 Token。
现在类似质量的任务可能只需要:
约 25 份。
对偶尔用一次 AI 的用户可能没那么明显。
但对于每天让 Agent 跑:
几十次;
几百次;
甚至企业级批量任务
的人来说,这个差距就非常大了。
六、为什么要分“标准”和“高级”?
因为真实办公任务根本没必要全部调用最强模型。
比如:
改格式;
总结文档;
提取数据;
普通写作;
信息搜索;
简单表格处理。
用旗舰模型深度思考十几轮,反而浪费时间和 Token。
所以未来千问办公会进一步变成:
标准模式
更快、更省。
覆盖约:
95% 日常办公任务。
高级模式
留给:
复杂研究;
重点分析;
高难度推理;
关键项目。
这其实就是一种更简单的:
模型路由。
用户不需要天天研究哪一个具体模型最划算。
先判断:
这个任务普通还是复杂。
七、Agent 真正开始进入“可以高频使用”的阶段
过去 Agent 最大的问题之一就是:
用不起。
你当然可以让 AI:
研究 100 个网页;
分析几十份文件;
连续干半小时。
但看着 Token 一直涨:
多少还是会心疼。
所以 Agent 真正普及,需要解决的不只是:
能力。
还包括:
单位任务成本。
Qwen3.8-Flash 这条路线其实很明显:
不是继续无限堆更大的模型。
而是提高:
智能密度。
用更少的激活参数、更高效的架构和更好的 Agent 协同,完成原本需要更重模型处理的任务。
这才是“Flash”真正有意思的地方。
结语
Qwen3.8-Flash 这次可以记住几个数字:
125B 总参数。
6B 激活参数。
1M 上下文。
128K 最大输出。
千问办公真实场景测试:
生成速度约提升100%。
Token消耗平均减少75%。
再加上:
标准模式覆盖约95%的日常办公任务。
相比单纯再发一个更强旗舰模型,这种“小激活参数 + 强 Agent 能力 + 低成本”的方向,对真正天天用 AI 的人可能反而更重要。
因为 Agent 最终想成为日常办公工具,不能每运行一次都让用户计算:
“这一轮又烧了多少 Token?”
真正好用的状态应该是:
任务直接丢进去,让它干就完了。
这可能才是所谓:
Agent 开始进入“量大管饱”时代。
相关链接
千问办公官网
千问办公帮助中心
千问AI平台 Qwen3.8-Flash 官方介绍
https://platform.qianwenai.com/docs/developer-guides/getting-started/latest-model
Qwen3.8-Flash 官方技术介绍
https://qwen.ai/blog?id=qwen3.8-flash-next
千问AI平台模型发布记录
https://platform.qianwenai.com/docs/changelog/models
千问AI平台
标签






评论 0
最新评论登录后发布评论并参与互动。
暂无评论,欢迎抢沙发。