2026年8月3日,阿里正式发布新一代旗舰模型 Qwen3.8-Max

image.png

这是目前千问系列规模最大、综合能力最强的旗舰模型,采用2.4万亿总参数、950亿激活参数的稀疏混合专家架构,支持100万Token上下文,以及文本、图片和视频输入。模型重点提升编程、真实办公、专业研究、视觉理解和长程任务执行能力。

Qwen3.8-Max已经通过以下渠道开放:

  • 阿里云百炼Model Studio
  • QwenCloud
  • Qoder
  • 千问办公QwenWork

开发者可以使用qwen3.8-max模型ID,通过OpenAI兼容、Anthropic兼容或DashScope接口调用。

阿里还宣布,将在下一周发布Qwen3.8-Max模型权重。这将是千问团队首次开放Max级旗舰模型的权重。按照8月3日公告时间计算,开放时间预计位于 2026年8月10日至16日,但官方尚未公布具体日期、许可证和下载地址。

Qwen3.8-Max是什么?

Qwen3.8-Max是基于Qwen3.5架构继续扩展的新一代多模态旗舰基础模型。

它并不只面向聊天问答,而是围绕能够持续数小时甚至数天工作的AI Agent进行训练,让模型可以自主规划、调用工具、读取文件、修改代码、检查结果,并根据执行反馈继续迭代。

阿里对Qwen3.8-Max的官方定位主要包括:

  • 自主编程
  • 真实办公
  • 专业研究
  • 长程任务
  • 多模态理解
  • 视觉智能体
  • 端到端成果交付

阿里云模型文档称,Qwen3.8-Max可以承担法律、金融、设计等数百种专业任务,并尝试在一次对话中完成从需求理解到生产级成果交付的完整流程。

Qwen3.8-Max核心规格

项目Qwen3.8-Max
模型架构稀疏混合专家模型,MoE
总参数量2.4T,约2.4万亿
激活参数量95B,约950亿
上下文窗口1,000,000 Token
最大输入长度991,808 Token
最大输出长度131,072 Token
最大思维链长度262,144 Token
输入模态文本、图片、视频
输出模态文本
Function Calling支持
结构化输出支持
上下文缓存支持
推理强度low、medium、xhigh
API模型IDqwen3.8-max
权重状态计划下周开放

以上规格来自阿里云Qwen3.8-Max模型文档和阿里官方发布信息。

2.4万亿参数并非全部同时参与推理

Qwen3.8-Max采用稀疏MoE架构。

模型总参数达到2.4万亿,但处理每个Token时只激活约950亿参数,约占全部参数的4%。模型会根据当前输入,将Token路由给更适合处理该内容的部分专家。

这种设计的主要目标是同时获得:

  • 更大的知识和能力容量
  • 更可控的单次计算量
  • 更低的响应延迟
  • 更适合长任务的推理成本
  • 更高的服务并发能力

但“950亿激活参数”并不意味着开放权重后可以把它当作普通95B模型部署。完整权重仍然包含2.4万亿参数,存储、显存和跨卡通信门槛预计都非常高。这是根据其参数规模作出的工程判断,具体硬件要求仍需等待官方部署文档。

混合注意力兼顾长上下文和推理效率

Qwen3.8-Max在稀疏MoE之外,还采用混合注意力机制。

阿里称,这套架构用于平衡超大参数规模、长上下文理解和实际推理效率,使模型在处理大型代码仓库、长篇文档、图片和视频内容时,不必让所有Token之间都执行同等规模的完整计算。

Qwen3.8-Max支持100万Token上下文,大致可以容纳:

  • 数百页专业文档
  • 大型软件代码仓库
  • 多份合同或行业报告
  • 较长的视频内容描述
  • 长时间Agent执行记录
  • 大量工具调用结果

官方表示,模型可以理解百页文档、完整电视剧集或长达100小时的直播内容,并将其整理为可搜索、可交互的知识结构。

不过,100万Token窗口不等于模型能够同等准确地使用其中每一条信息。实际应用仍然需要文件检索、上下文压缩、任务分段和历史摘要,避免无关资料占用窗口。

从Preview升级为正式版

Qwen3.8-Max-Preview于2026年7月19日率先进入Token Plan、Qoder和QoderWork,主要用于收集真实代码、办公和长程任务反馈。

预览版已经重点展示:

  • 全栈应用开发
  • 数据分析
  • Office工作流
  • 3D游戏生成
  • 网页及视觉内容
  • 长程Agent执行

Qoder曾将预览版描述为相比Qwen3.7-Max在编程、专业生产力和复杂长任务中取得全面提升。

8月3日上线的Qwen3.8-Max正式版已经替代预览版成为当前主力模型,并在Qoder全平台和阿里云百炼中正式提供。

“真实办公”指的是什么?

过去的大模型办公能力,通常集中在总结文章、生成邮件和制作PPT文案。

Qwen3.8-Max所强调的“真实办公”,更接近读取工作资料、调用工具并直接完成最终成果。

官方展示的任务覆盖:

  • 法律文档审查
  • 金融研究
  • 数据分析
  • 体育数据分析
  • 产品及应用设计
  • 建筑3D建模
  • 康复进度可视化
  • 专业报告制作
  • 客服对话意图分析
  • 餐饮产品概念设计

例如,用户可以将合同、业务数据、邮件和会议记录交给模型,再要求它:

  1. 找出风险条款
  2. 汇总不同部门意见
  3. 对比历史版本
  4. 制作修改建议
  5. 生成汇报文档
  6. 整理后续执行任务

模型需要在同一个任务中保持目标、调用不同工具,并交付可以继续编辑和审核的成果。

这与只在聊天框中返回一段建议存在明显区别。

支持图片、视频和文本统一理解

Qwen3.8-Max原生支持:

  • 文本输入
  • 图片输入
  • 视频输入
  • 文本输出

同时支持Function Calling、结构化输出、前缀续写和上下文缓存。

视觉能力可以参与Agent执行的不同阶段:

  • 观察网页和软件界面
  • 理解UI设计稿
  • 检查生成页面截图
  • 分析图表和报告
  • 读取视频内容
  • 根据视觉反馈继续修改
  • 将平面设计转换成可运行应用

阿里称,Qwen3.8-Max可以从一张UI截图重建完整前端项目,将二维户型图转换为三维室内可视化,也可以根据自然语言生成交互式游戏。

从个人视频素材生成完整Vlog

官方列出的多模态任务还包括读取个人原始视频素材,并完成专业Vlog剪辑。

在这类任务中,模型需要理解:

  • 视频中出现了哪些人物
  • 哪些片段更有价值
  • 内容应如何排序
  • 哪些画面适合作为开头
  • 字幕和旁白应该放在哪里
  • 节奏如何配合内容
  • 最终应该输出什么结构

Qwen3.8-Max本身输出的是文本,因此实际视频剪辑仍需通过Agent调用剪辑工具、代码或外部服务完成,而不是模型直接输出最终视频文件。

16天自主完成软件工程项目

阿里在Qwen3.8-Max正式发布时展示了一项长程代码实验。

模型从零开始构建一个名为 oh-my-cli的自进化代码Agent框架,并连续执行了16天。任务过程中,模型持续读取用户反馈、社区实践和自测数据,再反复完成代码生成、测试、预览和日志分析。

最终生成的oh-my-cli已经完整开放在GitHub,项目采用TypeScript和Node.js构建,支持文件、Shell、会话恢复、上下文压缩、任务状态和安全审批等能力。

项目地址:

https://github.com/qwen-code-dev-bot/oh-my-cli

这项实验说明,Qwen3.8-Max可以在具有明确环境和治理规则的情况下,持续执行远超普通聊天会话长度的软件工程任务。

不过,16天自主运行属于阿里内部实验,并非第三方统一测试。实际效果仍取决于:

  • Agent框架
  • 运行环境
  • 权限设置
  • 自动测试
  • 人工监督方式
  • 失败恢复机制
  • 上下文压缩策略

不能仅根据一次厂商案例,认定模型可以在所有代码仓库中连续运行16天且不需要人工干预。

什么是“闭环迭代”?

普通代码模型的工作流程通常是:

接收需求
↓
生成代码
↓
任务结束

长程Agent更完整的流程是:

理解目标
↓
制定计划
↓
编写代码
↓
运行程序
↓
观察输出
↓
读取错误
↓
修复问题
↓
重新测试
↓
继续完成后续任务

Qwen3.8-Max强化的不是单次代码输出,而是模型能否根据实际运行结果重新判断下一步行动。

这种能力对于复杂任务非常重要,因为真实工作很少可以一次完成。代码会报错,数据会缺失,网页效果可能不符合要求,工具也可能执行失败。

RecreationBench测试黑盒应用复刻

阿里还推出了RecreationBench,用于测试模型在完全黑盒环境中重建应用的能力。

测试时,模型无法访问互联网,也看不到目标应用的源代码,只能通过实际操作、观察界面和获取反馈,重新建立一个功能相近的应用。

这类任务需要模型同时完成:

  • 理解页面结构
  • 推测产品功能
  • 操作目标应用
  • 记录交互反馈
  • 设计自己的实现方案
  • 编写前端和后端代码
  • 启动项目
  • 比较运行结果
  • 持续修正差异

它更接近真实产品开发中的“观察—实现—验证”流程,而不是根据一张静态截图生成HTML。

Arena文本榜排名第五

根据Arena.ai在2026年8月1日的榜单快照,Qwen3.8-Max在Text Arena综合榜中获得1496±10分,排名第五,是当时得分最高的中国模型。

排名在它之前的四款模型均来自Anthropic。Qwen3.8-Max当前仍被标记为Preliminary,说明分数和排名可能随着新增盲测投票继续变化。

排名模型得分
1Claude Fable 51509±6
2Claude Opus 4.6 Thinking1505±4
3Claude Opus 4.7 Thinking1502±4
4Claude Opus 4.61497±4
5Qwen3.8-Max1496±10

Qwen3.8-Max与第四名只相差1分,但其置信区间较宽,因此不能根据单一分数断言模型已经稳定超过或追平某款Claude模型。

Vision Arena排名第二

在Vision Arena中,Qwen3.8-Max以1305±9分排名第二,仅次于Claude Fable 5的1318±9分。

这项成绩反映了模型在以下任务中的用户偏好:

  • 图片理解
  • 图表分析
  • 文档视觉解析
  • UI界面理解
  • 多模态问答
  • 视觉推理
  • 图片与文字联合任务

但Vision Arena是动态真人盲测,排名不能代替OCR准确率、视频理解、空间推理或企业文档测试等具体能力评估。

前端代码榜排名第四

在Arena Code WebDev综合榜中,Qwen3.8-Max以约1668分排名第四,仅落后于Claude Opus 5 Max、Kimi K3 Max和Claude Opus 5 High,领先GPT-5.6 Sol xHigh、GLM-5.2 Max和DeepSeek-V4-Flash。

该榜单重点衡量:

  • 网页需求理解
  • 前端代码生成
  • 页面视觉效果
  • 多步骤工具调用
  • 运行结果检查
  • 交互完整性
  • Agent式前端开发

需要注意,Qwen3.8-Max在该榜中的投票和置信区间仍处于初步阶段,后续名次可能变化。

参数规模仅次于Kimi K3

Qwen3.8-Max总参数为2.4万亿,略小于Kimi K3的2.8万亿。

两款模型都采用MoE架构、支持原生视觉理解和100万Token上下文,但它们的激活参数分别约为:

模型总参数激活参数
Kimi K32.8T104B
Qwen3.8-Max2.4T95B

参数数量并不能直接决定模型能力。训练数据、模型架构、后训练、Agent框架和工具环境都会影响最终表现。

从当前公开榜单看:

  • Kimi K3在前端代码榜仍更高
  • Qwen3.8-Max在文本综合榜排名更高
  • Qwen3.8-Max在Vision Arena排名第二
  • 两者都已进入全球顶级模型讨论范围

API已经正式开放

Qwen3.8-Max已经上线阿里云百炼,模型ID为:

qwen3.8-max

官方支持三种主要接口形式:

  • OpenAI兼容接口
  • Anthropic兼容接口
  • DashScope接口

服务已经覆盖北京、新加坡、东京、法兰克福和美国弗吉尼亚等地域。

一个OpenAI兼容的基础调用示例:

from openai import OpenAI

client = OpenAI(
    api_key="<你的阿里云百炼API Key>",
    base_url="https://dashscope.aliyuncs.com/compatible-mode/v1",
)

response = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[
        {
            "role": "user",
            "content": "分析这份项目资料,并制定可执行的交付计划。",
        }
    ],
)

print(response.choices[0].message.content)

具体Base URL需要根据所使用的阿里云地域和Workspace配置调整。

支持三档推理强度

Qwen3.8-Max支持通过reasoning_effort控制思考深度:

  • low
  • medium
  • xhigh

默认档位为xhigh。官方映射的思考预算分别约为4096、16384和262144 Token。

适合使用low的任务:

  • 内容改写
  • 信息提取
  • 简单分类
  • 普通邮件
  • 基础问答

适合使用medium的任务:

  • 文档分析
  • 数据总结
  • 常规代码任务
  • 研究报告初稿

适合使用xhigh的任务:

  • 长程Agent
  • 复杂软件工程
  • 多约束规划
  • 专业研究
  • 高难度推理

推理档位越高,通常意味着等待时间和思考Token消耗越多,不应对所有任务默认使用最高档。

多轮Agent需要完整回传思考历史

阿里云文档显示,Qwen3.8-Max默认开启preserve_thinking

在多轮对话中,客户端需要完整回传历史消息中的reasoning_content。这些历史思考内容也会计入输入Token并产生费用。

这对Agent开发者提出了几个要求:

  • 正确保存历史消息
  • 保留工具调用结果
  • 回传完整思考内容
  • 控制上下文增长速度
  • 及时压缩过长会话
  • 避免重复执行已经完成的任务

如果客户端只保存最终回答,而丢失历史推理和工具状态,后续长任务表现可能受到影响。

Qwen3.8-Max的API价格

阿里云百炼中国区原价为:

计费项目价格
输入12元/百万Token
输出36元/百万Token
输入缓存命中1.5元/百万Token
显式缓存创建15元/百万Token
显式缓存命中1元/百万Token

QwenCloud国际价格为:

计费项目价格
输入2美元/百万Token
输出6美元/百万Token

对于长程Agent,缓存能力非常重要。

大型代码仓库、系统规则和项目文档会在每一轮请求中重复出现。如果能够命中上下文缓存,可以明显降低重复输入成本。

当前限流能力

阿里云百炼在北京、东京、法兰克福和弗吉尼亚区域提供的默认限流为:

  • 30,000 RPM
  • 5,000,000 TPM

新加坡国际区域则为:

  • 15,000 RPM
  • 2,000,000 TPM

这些额度更适合企业级和高并发Agent应用,但具体账户可能受到开通状态、套餐或风控规则影响,应以控制台显示为准。

可以在Qoder中直接使用

Qwen3.8-Max已于8月3日正式上线Qoder,覆盖:

  • Qoder Desktop
  • Qoder JetBrains插件
  • Qoder CLI
  • QoderWake
  • Qoder Cloud Agents
  • Qoder移动端和网页端

开发者更新到最新版本后,可以在模型选择器中直接切换至Qwen3.8-Max。

Qoder还在正式发布期间提供模型调用奖励和夜间Credits折扣。活动时间、可领取次数和适用套餐可能调整,应以Qoder活动页面为准。

可以在千问办公中使用

Qwen3.8-Max也已接入千问办公QwenWork。

千问办公围绕文档、Excel、PPT、网页、数据分析和企业工作流提供任务交付能力,Qwen3.8-Max可以作为底层模型处理复杂办公和多步骤任务。

这使模型能够进入更完整的办公流程,例如:

  • 读取多份企业文档
  • 分析经营数据
  • 生成汇报PPT
  • 制作独立网页
  • 审阅合同
  • 整理项目计划
  • 调用外部数据源
  • 根据反馈继续修改成果

权重开放后意味着什么?

官方表示,Qwen3.8-Max将成为首个开放权重的Qwen Max级模型。

权重开放后,开发者和企业理论上可以进行:

  • 私有化部署
  • 行业微调
  • 推理框架适配
  • 量化和压缩
  • Agent专项后训练
  • 企业内部数据适配
  • 国产计算平台部署
  • 安全和行为研究

但目前尚未公布:

  • 权重具体发布日期
  • 开放许可证
  • 权重格式
  • 是否包含基础模型
  • 是否提供量化版本
  • 最低硬件要求
  • 推荐推理框架
  • 单机或集群部署方案

因此,现在只能确认“计划开放权重”,不能写成权重已经可以下载。

普通个人用户能够本地运行吗?

从2.4万亿总参数和950亿激活参数判断,即使模型提供低精度或量化权重,完整部署仍需要大型GPU集群。

开放权重的主要受益者可能包括:

  • 云计算平台
  • 大型企业AI团队
  • 高校与科研机构
  • 模型推理服务商
  • 量化和压缩团队
  • 国产硬件厂商
  • Agent训练平台

普通开发者更现实的方式仍然是使用QwenCloud、阿里云百炼、Qoder或千问办公,而不是下载完整权重在个人电脑上运行。

“端到端交付”不能理解为完全无人审核

Qwen3.8-Max强调从任务输入到最终成果的端到端交付。

但生产级结果仍应经过人工检查,特别是:

  • 法律合同
  • 金融研究
  • 财务数据
  • 对外发布内容
  • 生产代码
  • 用户隐私
  • 企业决策
  • 医疗相关资料

长程任务运行时间越长,错误也越可能在后续步骤中被放大。

企业Agent应该设置:

  • 工具权限边界
  • 文件修改记录
  • 高风险操作确认
  • 任务预算
  • 超时和重试限制
  • 版本控制
  • 自动测试
  • 最终人工验收

Qwen3.8-Max适合哪些用户?

软件开发团队

适合大型仓库分析、跨文件修改、测试、调试和长时间代码Agent任务。

企业办公团队

可用于合同、报告、数据、PPT及复杂业务资料处理。

产品经理和设计师

可以从需求、设计稿或页面截图出发,生成产品原型和交互应用。

金融及研究人员

适合阅读大量资料、整理证据和建立研究框架,但投资结论仍需人工审核。

Agent开发者

可以测试长程规划、工具调用、视觉反馈和闭环执行能力。

云服务与模型平台

权重开放后,可研究托管推理、行业模型和企业私有化部署。

当前需要注意哪些限制?

Arena排名仍处于初步阶段

Qwen3.8-Max在多个Arena榜中标记为Preliminary,新增投票可能改变排名。

16天项目属于官方案例

该项目能够公开检查,但整体运行条件和管理方式仍由阿里团队设置。

输出仍以文本为主

模型可以理解图片和视频,但不会直接输出图片或视频文件,需要通过工具完成多媒体生成与编辑。

长上下文成本较高

100万Token窗口适合大型任务,但一次性输入大量资料会增加费用和延迟。

完整权重尚未发布

当前仍不能确定许可证、量化方式和部署成本。

2.4万亿参数不等于综合能力一定更强

模型实际能力取决于架构、数据、后训练、Agent框架和任务类型,而不是只看总参数。

总结

Qwen3.8-Max于2026年8月3日正式上线。

模型采用2.4万亿总参数、950亿激活参数的稀疏MoE架构,支持100万Token上下文,以及文本、图片和视频输入。它重点提升了编程、真实办公、专业研究、视觉理解和复杂长程任务能力。

Arena.ai的8月1日榜单中,Qwen3.8-Max分别取得:

  • Text Arena第5名
  • Vision Arena第2名
  • Code WebDev第4名

当前排名仍处于初步阶段,会随盲测投票变化。

在长程代码实验中,Qwen3.8-Max曾连续16天运行,自主构建并持续维护oh-my-cli代码Agent项目。阿里还通过RecreationBench测试模型在没有源码和互联网的情况下,通过操作和视觉反馈重建应用。

API目前已经上线阿里云百炼和QwenCloud,支持OpenAI、Anthropic和DashScope接口,国内价格为每百万Token输入12元、输出36元。

官方计划在下一周开放Qwen3.8-Max模型权重。这是千问团队首次计划开放Max级旗舰模型,但具体日期、许可证、量化版本和部署要求仍未公布。

Qwen3.8-Max展现出的方向已经很明确:

大模型正在从完成一次回答,走向在真实环境中持续工作、检查结果并交付完整成果。

真正决定它能否进入企业生产环境的,不只是2.4万亿参数和榜单成绩,而是长任务成功率、工具调用稳定性、成本、权限控制,以及权重开放后的实际部署能力。

相关链接