推荐Lovart 中文版 - 一站式 AI 设计平台推荐一人企业Vibe Coding社区!热门AI设计工具新品免费AI编程工具 Trae - 智能编码助手Seedance2.5已上线新用户注册即领免费算力
UIED.CN今天偷学哪一招,朋友

千问办公进入“量大管饱”模式:Qwen3.8-Flash 上线,Token 平均少烧 75%

image.png

Agent 现在越来越能干,但一个现实问题也越来越明显:

太烧 Token 了。

做一次聊天可能只需要几千 Token。

但真正让 Agent 去:

查资料、读文件、规划任务、调用工具、修改内容、反复检查……

一次复杂任务很容易把 Token 消耗拉到普通聊天的数倍甚至数十倍。

千问办公这次干脆从底层换了一套“省油发动机”。

8 月 26 日晚,千问办公首发上线 Qwen3.8-Flash,并同步推出全新的:

标准模式。

以后模型供给会进一步简化成:

标准模式 + 高级模式。

官方给出的定位很直接:

95% 的日常办公任务交给标准模式,剩下约 5% 的复杂任务再使用高级模式。




一、Qwen3.8-Flash 不是简单的“小模型”

虽然名字叫 Flash,但它并不是单纯为了追求速度而大幅牺牲能力。

Qwen3.8-Flash 采用一套全新架构,也是:

Qwen4 架构的提前预览。

模型主体总参数:

125B。

但每个 Token 实际只激活:

6B 参数。

另外还加入约 51B 的 N-gram Embedding 参数,在尽量少增加实际计算量的情况下继续扩展模型容量。

简单理解就是:

模型知道得更多,但每次真正干活时不用把所有参数都跑一遍。

这也是它能够同时兼顾:

性能、速度和成本

的重要原因。




二、官方评测里,部分编程和办公任务已经超过 Claude Opus 4.6

“Flash”最大的惊喜其实不是便宜。

而是能力并没有掉到传统小模型的水平。

官方公布的测试中:

SWE-bench Pro:

Qwen3.8-Flash:62.5

Claude Opus 4.6:53.4

长程办公任务 CoWorkBench:

Qwen3.8-Flash:73.9

Claude Opus 4.6:68.2

多语言软件工程:

81.0 vs 77.5。

所以更准确的说法应该是:

Qwen3.8-Flash 在多个 Coding 和办公 Agent Benchmark 中已经超过 Claude Opus 4.6。

而不是笼统地说所有能力全面超过。




三、1M 上下文,Flash 也开始跑长任务

Qwen3.8-Flash 原生服务版本支持:

1,000,000 Token 上下文。

最大输出:

128K Token。

同时支持:

文字;

图片;

视频

多模态理解。

这对办公 Agent 很重要。

因为真实任务里很容易同时出现:

几十份文档;

大型 Excel;

网页资料;

历史聊天;

长报告;

截图;

视频。

上下文足够长以后,Agent 才更适合连续做:

长文档分析;

大型代码库;

深度研究;

复杂办公自动化。




四、真正的重点其实是:模型和 Agent 一起优化

千问办公这次并不是简单:

把底层模型从 A 换成 Qwen3.8-Flash。

千问模型团队还专门为办公场景做了一版 Qwen3.8-Flash。

重点优化:

多步规划

工具选择

上下文压缩

这些 Agent 高频任务。

同时,千问办公又在推理侧和 Harness 架构继续优化。

整个逻辑其实就是:

Qwen3.8-Flash
+
办公场景专项训练
+
推理优化
+
Harness
+
Agent工作流
=
千问办公标准模式

这也是现在 Agent 竞争越来越明显的一个趋势:

模型强还不够,模型和 Harness 得一起调。




五、真实办公测试:速度翻倍,Token平均减少75%

这次千问办公对外披露的一组数据比较直观。

在真实办公场景测试中:

单任务 Token 生成速度约提升 100%。

同时:

Token 消耗平均减少约 75%。

也就是以前一个任务可能要消耗:

100 份 Token。

现在类似质量的任务可能只需要:

约 25 份。

对偶尔用一次 AI 的用户可能没那么明显。

但对于每天让 Agent 跑:

几十次;

几百次;

甚至企业级批量任务

的人来说,这个差距就非常大了。




六、为什么要分“标准”和“高级”?

因为真实办公任务根本没必要全部调用最强模型。

比如:

改格式;

总结文档;

提取数据;

普通写作;

信息搜索;

简单表格处理。

用旗舰模型深度思考十几轮,反而浪费时间和 Token。

所以未来千问办公会进一步变成:

标准模式

更快、更省。

覆盖约:

95% 日常办公任务。

高级模式

留给:

复杂研究;

重点分析;

高难度推理;

关键项目。

这其实就是一种更简单的:

模型路由。

用户不需要天天研究哪一个具体模型最划算。

先判断:

这个任务普通还是复杂。




七、Agent 真正开始进入“可以高频使用”的阶段

过去 Agent 最大的问题之一就是:

用不起。

你当然可以让 AI:

研究 100 个网页;

分析几十份文件;

连续干半小时。

但看着 Token 一直涨:

多少还是会心疼。

所以 Agent 真正普及,需要解决的不只是:

能力。

还包括:

单位任务成本。

Qwen3.8-Flash 这条路线其实很明显:

不是继续无限堆更大的模型。

而是提高:

智能密度。

用更少的激活参数、更高效的架构和更好的 Agent 协同,完成原本需要更重模型处理的任务。

这才是“Flash”真正有意思的地方。




结语

Qwen3.8-Flash 这次可以记住几个数字:

125B 总参数。

6B 激活参数。

1M 上下文。

128K 最大输出。

千问办公真实场景测试:

生成速度约提升100%。

Token消耗平均减少75%。

再加上:

标准模式覆盖约95%的日常办公任务。

相比单纯再发一个更强旗舰模型,这种“小激活参数 + 强 Agent 能力 + 低成本”的方向,对真正天天用 AI 的人可能反而更重要。

因为 Agent 最终想成为日常办公工具,不能每运行一次都让用户计算:

“这一轮又烧了多少 Token?”

真正好用的状态应该是:

任务直接丢进去,让它干就完了。

这可能才是所谓:

Agent 开始进入“量大管饱”时代。




相关链接

千问办公官网

https://qwenwork.cn/

千问办公帮助中心

https://qwenwork.cn/docs

千问AI平台 Qwen3.8-Flash 官方介绍

https://platform.qianwenai.com/docs/developer-guides/getting-started/latest-model

Qwen3.8-Flash 官方技术介绍

https://qwen.ai/blog?id=qwen3.8-flash-next

千问AI平台模型发布记录

https://platform.qianwenai.com/docs/changelog/models

千问AI平台

https://www.qianwenai.com/






标签

评论 0

最新评论

登录后发布评论并参与互动。

暂无评论,欢迎抢沙发。

推荐阅读

查看更多