Kimi K3发布后,国产旗舰模型的更新节奏仍未放缓。
阿里于2026年7月19日上线新一代旗舰基座模型 Qwen3.8-Max-Preview。模型总参数达到2.4T,即约2.4万亿参数,目前已经进入阿里云Token Plan、Qoder、QoderWork及Qoder系列Agent产品。正式版将在后续推出,阿里也计划开放模型权重。
阿里将Qwen3.8描述为当前能力较强的前沿模型之一,并称其整体表现仅次于Anthropic的Fable 5。需要说明的是,阿里目前尚未在公开技术报告中提供完整的基准配置和逐项成绩,因此网上流传的“击败所有Opus模型”等说法,现阶段仍应视为预览期数据或社交媒体截图,而不是已经完成独立验证的正式结论。

Qwen3.8-Max-Preview是什么?
Qwen3.8-Max-Preview是通义千问新一代旗舰基础模型的预览版本。
Qoder官方资料显示,模型拥有2.4T参数。相比上一代Qwen3.7-Max,Qwen3.8重点增强了以下能力:
- 代码工程与软件开发
- 专业办公与知识工作
- 全栈应用开发
- Office办公工作流
- 数据分析
- 深度推理
- 复杂长程任务
- 多步骤Agent执行
Qoder将其描述为在软件工程、办公和深度推理方面表现领先的新一代基础模型,并表示其能力仍在持续迭代。
目前能够确认的核心参数并不多:
| 项目 | 当前公开信息 |
|---|---|
| 模型名称 | Qwen3.8-Max-Preview |
| 总参数规模 | 2.4T |
| 产品状态 | Preview预览版 |
| 重点能力 | Coding、Cowork、深度推理、长程Agent |
| 当前入口 | Token Plan、Qoder、QoderWork等 |
| 正式版 | 计划后续推出 |
| 模型权重 | 阿里称将开放,尚未正式发布 |
| 架构与激活参数 | 尚未完整公布 |
| 开放许可证 | 尚未公布 |
| 本地部署要求 | 尚未公布 |
因此,目前不宜直接认定Qwen3.8采用某一种MoE结构,也不能推算单次推理会激活多少参数。相关信息需要等待正式模型卡或技术报告。
Qwen3.8目前可以在哪里使用?
Qwen3.8-Max-Preview已经覆盖Qoder的多种产品形态,包括:
- Qoder Desktop
- QoderWork
- Qoder JetBrains插件
- Qoder CLI
- QoderWake
- Qoder Cloud Agents
- Qoder Mobile及Web App
开发者和知识工作者可以在模型选择器中切换至Qwen3.8-Max-Preview,测试代码工程、数据分析、文档处理和长时间Agent任务。
阿里云Token Plan个人版和团队版也已支持该模型。官方明确提示,Qwen3.8当前仍是预览版本,能力会在预览期持续更新;预览结束后,现有模型可能下线或被正式版本替换。
预览期调用价格大幅降低
为了扩大预览版测试规模,Qoder与阿里云Token Plan为Qwen3.8提供了限时折扣。
Qoder当前的Credits消耗倍率为:
| 使用时间 | 标准倍率 | 活动倍率 |
| 08:00—22:00 | 0.5x | 0.05x |
| 22:00—次日08:00 | 0.5x | 0.01x |
常规时间相当于1折,夜间低峰时段相当于0.2折。活动从2026年7月19日开始,结束时间暂未公布。
阿里云Token Plan也提供预览期Credits低至1折、夜间进一步折扣等权益。通过降低调用成本,更多用户可以运行持续时间较长、Token和工具调用量较大的Agent任务。
15分钟生成可玩的3D射击游戏
Qwen3.8上线后,社交平台很快出现了第一批软件开发实测。
一名开发者使用相同的3D射击游戏需求测试Qwen3.8和Fable 5。据其分享,Qwen3.8大约用15分钟生成了一个能够直接游玩的版本,基础移动、射击、难度和游戏机制已经可以运行;Fable 5则花费约50分钟完成同类任务。
这次测试呈现出的差异是:
- Qwen3.8更快完成第一个可用版本
- Fable 5耗时更长,但最终细节更精致
- Qwen3.8更偏向先建立完整功能
- Fable 5更愿意投入时间完善表现效果
这只是单个开发者、单次任务中的结果,并没有公开完整系统提示词、运行环境、Token消耗和全部修改过程,不能直接作为两款模型整体能力的排名依据。
不过,它展现了Qwen3.8当前较有价值的一项特点:先把产品做出来,再继续调整细节。
Agent模型为什么需要“快速出活”?
代码Agent的价值不只体现在最终代码有多复杂,也体现在它能否尽快建立一个可以运行、测试和修改的版本。
传统模型可能花费大量时间分析:
- 应该选择哪套框架
- 页面如何组织
- 游戏架构如何设计
- 是否需要增加额外功能
- 哪种实现方式更加完整
这些思考可能提高最终质量,但也可能导致模型迟迟没有可见结果。
更偏向执行的Agent则会先完成:
- 建立项目结构
- 实现最基础玩法
- 运行程序
- 找到明显错误
- 修复关键问题
- 输出第一版成果
- 再根据反馈优化
对于Vibe Coding、原型验证和早期产品开发来说,一个15分钟内可以操作的版本,往往比一个50分钟后才出现、但细节更精致的版本更容易进入下一轮迭代。
Minecraft风格体素游戏也能一次运行
另一名用户要求Qwen3.8-Max-Preview制作一个Minecraft风格的体素游戏。
其分享的初步结果显示,Qwen3.8生成了较干净的界面,并实现了可以直接操作的游戏内容。测试者将其总结为代码能力较强、UI相对整洁、输出可玩且第一版完成度较高。
这类任务通常要求模型同时处理:
- 3D场景和摄影机
- 体素地图
- 人物或视角控制
- 键盘及鼠标输入
- 碰撞关系
- UI和状态显示
- 游戏循环
- HTML、JavaScript和Three.js代码
它并不是单一函数生成,而是一个需要多个模块同时运行的小型软件项目。
Qwen3.8开始从代码生成走向产品交付
现有测试说明,Qwen3.8的目标并不只是生成代码片段,而是围绕用户最终需要的成果完成持续工作。
目前用户已经开始用它测试:
- 3D射击游戏
- Minecraft风格体素游戏
- 产品营销落地页
- 交互式网页
- 数据分析
- Office办公任务
- 多步骤代码工程
- 长程Agent工作流
Qoder官方也将全栈开发、数据分析和Office工作流列为Qwen3.8的主要提升方向。
这种产品定位更加接近“交付型Agent”:
用户告诉模型需要得到什么,模型自行决定需要建立哪些文件、调用什么工具、如何运行验证,以及何时交付第一个可用版本。
与Kimi K3对比:各有明显侧重
Qwen3.8发布前不久,月之暗面刚刚上线2.8T参数的Kimi K3。Qoder的模型列表已经同时提供Qwen3.8-Max-Preview和Kimi K3,方便开发者在同一产品环境中进行测试。
从目前公开案例看,两者呈现出不同特点:
| 对比方向 | Qwen3.8-Max-Preview | Kimi K3 |
| 总参数 | 2.4T | 2.8T |
| 当前状态 | 预览版 | 正式服务已上线 |
| 代码任务 | 强调快速形成可运行结果 | 强调长程工程与复杂交付 |
| 视觉设计 | 部分测试仍需提升 | 部分前端和视觉任务表现更强 |
| 3D内容 | 已出现多个可玩游戏案例 | 3D、视觉闭环和交互内容较突出 |
| 开放权重 | 计划开放 | 已公布完整权重发布计划 |
| 成熟度 | 持续迭代中的Preview | 已进入多款正式产品 |
在你提供的另一项社交媒体案例中,有开发者让Qwen3.8和Kimi K3分别为一台售价1万美元的“断头台式面包切割机”制作产品落地页。
该体验反馈认为,Kimi K3在整体文字处理和视觉构图方面优势较明显,但Qwen3.8成功生成了具有说服力的产品3D模型。由于该测试的原始运行记录和完整页面尚未公开,它更适合作为模型风格差异的体验参考。
Qwen3.8当前也存在明显问题
Preview版本提前进入真实用户场景,可以快速发现问题,但也意味着其表现尚未完全稳定。
部分社区用户报告,Qwen3.8在长任务中可能出现:
- 反复尝试相同方案
- 工具调用进入循环
- 过度分析简单问题
- 执行方向逐渐偏移
- 遇到安全任务时绕路
- 最终没有完成原始目标
LocalLLaMA社区中已有用户认为,当前预览检查点仍需要更多后训练,尤其需要改善循环执行和Agent边界。
这些问题与阿里云对Preview版本的提示一致:模型能力仍会持续升级,最终正式版可能替换当前预览版本。
“击败所有Opus”目前不能视为官方结论
社交平台流传的Qwen3.8测试图表显示,其部分综合成绩超过多款Opus模型,仅次于Fable 5。
阿里也公开表示,Qwen3.8是当前较强的模型之一,整体水平仅次于Fable 5。
但目前仍缺少以下信息:
- 完整评测名称
- 测试题目和数据集
- 模型具体版本
- 系统提示词
- 推理强度
- 工具和联网权限
- 测试次数
- 置信区间
- 第三方独立复现
因此,SEO文章可以写“阿里称Qwen3.8仅次于Fable 5”,但不宜直接写成“权威测试确认Qwen3.8击败所有Opus”。
更稳妥的表述是:
社交媒体流传的早期成绩显示,Qwen3.8具备接近顶级闭源模型的潜力,但仍需等待正式技术报告和第三方评测。
2.4T开放权重意味着什么?
阿里计划在正式版推出后开放Qwen3.8模型权重。
如果权重按计划开放,开发者可以进一步研究:
- 模型具体架构
- 混合专家设计
- 激活参数规模
- 本地与集群推理效率
- 量化效果
- 行业微调
- 私有化部署
- 推理框架适配
- Agent后训练
不过,2.4T总参数也意味着完整模型可能需要极高的存储、显存和集群通信能力。
即使模型权重开放,普通个人电脑也很难完整运行。大多数开发者可能仍会通过阿里云、Qoder或第三方推理服务使用模型。
正式发布后需要重点关注:
- 权重是否完整开放
- 基础版和指令版是否同时发布
- 具体许可证
- 商业使用限制
- 激活参数
- 上下文窗口
- 是否提供量化权重
- vLLM和SGLang支持
- 推理硬件要求
Qwen3.8与Kimi K3释放了什么信号?
Kimi K3和Qwen3.8在数天内连续出现,说明国产旗舰模型已经从单纯比较知识和数学基准,转向真实Agent任务竞争。
新的重点包括:
- 能否持续运行数十分钟或数小时
- 能否调用终端和浏览器
- 能否制作可运行的软件
- 能否理解图片和视觉反馈
- 能否在长任务中保持目标
- 能否用更少时间交付第一版
- 能否控制Token和算力成本
- 是否能够开放模型权重
对于用户来说,模型是否能在15分钟内做出一个可玩的游戏,往往比某项抽象基准高出几分更加直观。
Qwen3.8适合哪些用户提前体验?
独立开发者
可以用来快速制作网站、小游戏、插件和产品原型。
Vibe Coding用户
通过自然语言描述功能,测试模型能否直接生成可以运行的项目。
前端和全栈开发者
适合测试跨文件修改、页面生成、接口开发和项目调试。
产品经理与设计师
可以将产品想法快速转换为交互原型,再根据结果补充需求。
数据与办公用户
通过QoderWork测试表格分析、报告生成和Office工作流。
Agent开发者
重点评估模型在工具调用、错误恢复、上下文保持和任务完成率方面的表现。
使用Preview模型需要注意什么?
不要直接替换生产环境模型
预览版可能频繁更新,同一个提示词在不同日期可能得到不同结果。
保存测试条件
应记录模型版本、运行时间、提示词、工具环境和最终成果,方便后续与正式版比较。
检查代码和依赖
可运行不代表代码安全、结构合理或能够长期维护。
限制Agent权限
删除文件、部署生产环境和操作账号等行为应保留人工确认。
不要只看单次成功案例
应使用相同任务运行多次,并记录失败率、Token成本和人工修改时间。
总结
Qwen3.8-Max-Preview已经于2026年7月19日进入阿里云Token Plan、Qoder和QoderWork,模型总参数达到2.4T,重点提升软件工程、专业办公、深度推理和复杂长程Agent能力。
阿里称Qwen3.8属于当前较强的前沿模型,整体能力仅次于Fable 5,并计划在正式版推出后开放模型权重。完整基准、模型架构、许可证和本地部署要求仍待公布。
首批社交媒体实测显示,Qwen3.8能够较快生成可玩的3D射击游戏和Minecraft风格体素游戏。在一项个例中,模型约15分钟完成了第一版,而Fable 5完成同类任务约用了50分钟。
Qwen3.8当前的优势并不一定是所有细节都比Fable 5或Kimi K3更精致,而是能够较快将需求转换为可运行成果。
这可能正是Agent模型最实际的价值:
不是长时间展示自己会思考,而是先把能用的东西做出来。
不过,Qwen3.8仍处于Preview阶段,部分用户已经遇到工具调用循环、任务绕路和视觉细节不足等问题。它能否在正式版中稳定进入全球第一梯队,还需等待开放权重、技术报告和第三方测评。










评论区 (0)
最新评论登录后发布评论并参与互动。
暂无评论,欢迎抢沙发。