推荐Lovart 中文版 - 一站式 AI 设计平台推荐一人企业Vibe Coding社区!热门AI设计工具新品免费AI编程工具 Trae - 智能编码助手Seedance2.5已上线新用户注册即领免费算力
UIED.CN今天偷学哪一招,朋友

小米这次不只开源模型:MiMo-V2.6 登顶 AA 开放权重榜,连 7000+ RL 环境都放出来了

小米 MiMo 新模型,终于正式发布了。

image.png

这次一口气带来:

MiMo-V2.6-Pro

MiMo-V2.6-Flash

以及更轻量的:

MiMo-V2.6-Distill-Qwen-9B。

其中,MiMo-V2.6-Pro 在最新 Artificial Analysis Intelligence Index 中取得:

46 分。

截至目前,排在大型开放权重模型榜单:

第 1 名。

不过这次真正值得关注的,并不只是一个“开源模型第一”。

小米同步放出来的还有:

模型权重。

完整技术报告。

7000+ 高质量 RL 任务环境。

端到端强化学习框架。

可组合 mini-harnesses。

也就是说,小米这次不只是把训练好的模型交出来。

而是连:

模型到底怎么继续训练、在哪些环境里训练、如何评估和调用工具

都开始一起开放。



一、Pro 和 Flash,都已经是原生全模态模型

MiMo-V2.6 系列包含两个核心版本。

MiMo-V2.6-Pro

定位是当前 MiMo 系列中能力最强的旗舰模型。

采用 Sparse MoE 架构:

总参数 1.02T。

每个 Token 激活约 42B 参数。

上下文长度:

100 万 Token。

MiMo-V2.6-Flash

定位是能力、速度和成本更加平衡的高频版本。

同样采用 Sparse MoE:

总参数 309B。

每个 Token 激活约 15B 参数。

上下文也达到:

100 万 Token。

两款模型都原生支持:

文本。

图片。

视频。

音频。

输出形式目前以文本为主。

所以它们不只是传统语言模型增加一个视觉接口,而是从架构和训练阶段就围绕多模态、长上下文和 Agent 任务进行统一设计。



二、46 分到底是什么水平?

MiMo-V2.6-Pro 当前在 Artificial Analysis Intelligence Index 中取得:

46 分。

在 Artificial Analysis 当前划分的“大型开放权重模型”类别中,排名:

第 1 / 114。

需要注意,这里的准确说法应该是:

当前 AA 大型开放权重模型第一。

而不是不加任何限定地写成:

“全球所有模型第一。”

因为在最强闭源旗舰模型面前,MiMo-V2.6-Pro 仍然存在差距。

而且 Artificial Analysis 会持续调整评测集和计算方式,同一模型在不同版本指数中的分数也可能变化。

但即便如此,46 分依然说明:

小米 MiMo 已经正式进入全球开放权重模型的头部区域。



三、真正有意思的,是“递归自我改进”

小米将 MiMo-V2.6 的核心技术路线概括为:

Scaling Reinforcement Learning Toward Self-Improvement。

也就是:

通过扩大强化学习,让模型在反馈中持续自我改进。

这里的“自我改进”,并不是指模型脱离人类控制,自己修改源码、自己发布下一代版本。

更准确的理解是:

模型在强化学习环境中反复执行任务。

同一道任务会生成多条不同的解决路径。

系统再比较这些路径:

谁真正完成了任务?

谁走得更短?

谁消耗的 Token 更少?

谁虽然成功了,但过程存在风险?

最后把更高质量的执行方式转化成更精细的奖励信号,再继续推动模型更新。

整个过程大概是:

模型执行任务
↓
生成多条不同轨迹
↓
测试与验证结果
↓
比较成功轨迹的质量
↓
把奖励分配给更好的路径
↓
继续训练模型

过去很多 RL 任务只看:

成功还是失败。

但如果两条轨迹都成功了,一条用了 20 步,另一条只用了 8 步,显然后者更值得学习。

MiMo-V2.6 的 Groupwise Agentic Grading,就是想继续解决:

成功答案之间,谁做得更好。



四、这条 RL 路线,确实很烧算力

为了完成这轮训练,小米还公开直播了 MiMo-V2.6 的强化学习过程。

按照官方披露:

Pro 和 Flash 的公开 RL 训练持续不到 6 天。

两款模型分别完成 30 个训练 Step。

累计生成约:

75 万条 Agent 轨迹。

Flash 的公开训练成本约:

85 万美元。

Pro 则约为:

262 万美元。

每次更新会使用:

1568 个 Prompt × 16 次 Rollout。

单个训练 Step 处理的 Token 规模达到数十亿级。

这也解释了为什么大模型的 Agent 能力不能只靠:

多收集一点问答数据。

真正训练长程 Agent,需要模型不断进入:

代码仓库;

电脑环境;

浏览器;

网络安全靶场;

复杂工具链

中反复尝试。

而这些任务的成本,远高于普通文本问答训练。



五、“You Only RL Once”:不再为每个领域单独练一遍

MiMo-V2.6 还有一个挺有意思的设计:

You Only RL Once。

过去训练 Agent 模型,往往会把不同领域拆开。

代码任务单独训练。

视觉任务单独训练。

网络安全再单独训练。

不同 Harness 甚至还要重新适配一遍。

MiMo-V2.6 则把:

Coding。

通用 Agent。

视觉任务。

网络安全。

以及不同 Harness 的任务,放进同一套混合 RL 训练中。

希望不同能力之间互相迁移。

比如模型在软件工程中学会:

先查看环境;

再制定计划;

执行以后检查结果;

发现失败再修复。

这套策略不只可以用于代码,也可能迁移到:

Computer Use;

网页操作;

3D 建模;

办公自动化。

甚至在训练时没有见过的 Agent Harness 中,模型也能更快适应。



六、7000+ RL 环境,可能比模型权重更有价值

很多开源模型发布,通常到这一步就结束了:

放一个权重。

再提供一份模型卡。

但开发者真正想继续训练模型时,很快会碰到新的问题:

任务从哪里来?

执行环境怎么搭?

结果怎么验证?

奖励怎么计算?

Harness 怎么连接?

这次小米同步开放了超过:

7000 个高质量 RL 任务环境。

主要覆盖四个方向:

软件工程。

漏洞复现。

知识密集型工作。

网页设计与开发。

这些环境不是普通问答数据。

而是可以让 Agent 真正进入环境中:

读文件;

写代码;

调用工具;

运行测试;

操作网页;

提交结果。

再由 Verifier 判断任务到底有没有完成。

对于 Agentic RL 来说,真正稀缺的往往已经不只是模型,而是:

可执行、可验证、可以反复训练的真实任务环境。



七、连完整 RL 训练框架也一起放出来了

除了任务环境,小米还开放了一套端到端强化学习框架。

整个链路覆盖:

环境交互
↓
Agent执行任务
↓
轨迹收集
↓
结果验证
↓
奖励计算
↓
策略更新

框架建立在 verl、uni-agent 和 mini-swe-agent 等项目之上。

开发者可以把:

开放模型;

任务环境;

奖励机制;

Agent Harness

重新组合起来,继续研究自己的强化学习方法。

小米还提供了更加轻量的:

Composable Mini-Harnesses。

它会把 Agent 中的:

系统提示词;

工具;

上下文管理;

执行流程

拆成相对独立的模块。

研究者可以自由组合不同配置,观察:

同一个模型放进不同 Harness 后,能力会发生什么变化。

这其实和现在越来越热的 Harness Engineering 是同一个方向。



八、Pro 和 Flash,真实 Agent 表现怎么样?

按照小米官方公布的测试结果:

DeepSWE v1.1

MiMo-V2.6-Pro:

71.9

MiMo-V2.6-Flash:

67.9

AutomationBench

Pro:

53.1

Flash:

52.3

Toolathlon-Verified

Pro:

76.9

Flash:

73.6

Terminal Bench 2.1

Pro:

89.9

Flash:

87.6

OSWorld-Verified

Pro:

82.0

Flash:

80.8

MiMo VisualCoding

Pro:

72.3

Flash:

71.5

可以看到,Pro 和 Flash 的差距并没有参数规模看起来那么大。

Flash 虽然激活参数只有 15B,但在大量 Agent 任务中仍然接近 Pro。

所以两者的分工会比较明确:

Pro 负责能力上限。

Flash 负责高频和规模化任务。

不过这些单项成绩主要来自小米官方测试,实际效果仍然需要结合第三方评测和真实项目继续验证。



九、还有一款 9B 蒸馏模型,专门降低研究门槛

这次开源包里还有:

MiMo-V2.6-Distill-Qwen-9B。

它的意义不是取代 Pro 或 Flash。

而是给普通研究者提供一个更加容易部署、继续做 Agentic RL 实验的起点。

毕竟:

1T 级 Pro 模型即使开放权重,也不是普通开发者几张显卡就能轻松跑起来的。

9B 模型则更适合:

本地实验;

环境验证;

Agent Harness 研究;

小规模强化学习;

垂直任务微调。

小米还公开了从这款 9B 蒸馏模型出发进行 RL 的结果,在软件工程、网络安全、终端任务和视觉编程等多项评测中,都比原始 SFT 版本进一步提高。



十、这次“开源”不只是放个权重文件

严格来说,Artificial Analysis 使用的是:

Open Weights,开放权重模型。

但 MiMo-V2.6 这次开放的内容已经明显超过单纯权重:


  • Pro 与 Flash 模型权重;

  • MIT 许可证;

  • 9B 蒸馏模型;

  • 完整技术报告;

  • 7000+ RL 任务环境;

  • 端到端 RL 训练框架;

  • 可组合 Mini-Harnesses;

  • 公开训练过程和指标。

所以这次称为“开源发布”,并不只是营销上的说法。

它真正把 Agent 强化学习中的很多关键组件一起交给了社区。



十一、现在可以在哪里使用?

除了自行下载权重,MiMo-V2.6 也已经进入小米自己的产品体系。

目前可以通过:

MiMo Desktop。

MiMo Studio。

MiMo Code。

小米 MiMo 开放平台 API。

以及部分第三方模型平台使用。

API 价格继续沿用 V2.5 的标准,没有因为智能水平提高同步涨价。

Pro 还提供:

UltraSpeed 高速模式。

官方表示,特定场景下生成速度最高可提升至普通版本的 20 倍,主要面向实时交互和对延迟敏感的工作流。



结语

MiMo-V2.6 这次可以记住几组数字:

Pro:1.02T 总参数,42B 激活。

Flash:309B 总参数,15B 激活。

两款模型均支持:

100 万 Token 上下文。

文本、图片、视频和音频输入。

MiMo-V2.6-Pro 在 AA Intelligence Index 取得:

46 分。

暂居当前大型开放权重模型:

第 1 名。

但我觉得,这次真正值得关注的并不是“第一”这两个字。

排行榜随时会变化。

真正更长期的价值,是小米开始把:

模型权重 + RL 环境 + 训练框架 + Harness + 蒸馏模型

完整放到一起。

过去开源大模型的竞争,主要看:

谁愿意开放权重。

接下来可能还要继续看:

谁愿意开放模型变强的方法。

7000 多个任务环境、端到端 RL 框架和 Mini-Harnesses,才可能是 MiMo-V2.6 这次真正的大招。

小米不只是交出了一条鱼。

连池塘、钓竿,以及怎么继续养鱼的方法,都开始一起放出来了。



相关链接

小米 MiMo-V2.6 官方介绍

https://mimo.xiaomi.com/mimo-v2-6

MiMo-V2.6 官方更新说明

https://mimo.mi.com/docs/en-US/news/latest/v2-6

MiMo-V2.6 Hugging Face 合集

https://huggingface.co/collections/XiaomiMiMo/mimo-v26

MiMo-V2.6-Pro-RL

https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Pro-RL

MiMo-V2.6-Flash-RL

https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Flash-RL

MiMo-V2.6-Distill-Qwen-9B

https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Distill-Qwen-9B

MiMo-V2.6 技术报告

https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Pro-RL/blob/main/MiMo_V2_6_technical_report.pdf

MiMo-V2.6 RL 训练看板

https://mimo.xiaomi.com/rl/

小米 MiMo 开放平台

https://platform.xiaomimimo.com/

MiMo Desktop

https://mimo.xiaomimimo.com/desktop/

Artificial Analysis:MiMo-V2.6-Pro

https://artificialanalysis.ai/models/mimo-v2-6-pro











评论 0

最新评论

登录后发布评论并参与互动。

暂无评论,欢迎抢沙发。

推荐阅读

查看更多