
谷歌 DeepMind 正式发布 SIMA 2,一款面向虚拟 3D 世界的通用智能体。依托 Gemini 技术体系,SIMA 2 能够在多种复杂的游戏与虚拟场景中执行任务,并逐步提升其行为规划能力与任务完成效果。
与前代相比,SIMA 2 的表现取得显著提升:
- 任务完成率达到 62%,逐步接近人类玩家水平
- 能处理 语言、语音、图形、界面元素、表情符号等多模态信息
- 具备 自我改进机制,能通过虚拟世界学习强化自身能力
这一里程碑让 SIMA 2 不仅是一款“能玩游戏的智能体”,更是一种正在向通用场景适配、不断自我优化的智能系统。
一、什么是 SIMA 2?面向未来虚拟场景的通用智能体
SIMA(Scalable Instructable Multiworld Agent)是 DeepMind 早先提出的多世界智能体框架,用于测试 AI 在自然语言指令与虚拟空间交互的能力。SIMA 2 是该系列的全新升级版本,核心能力已大幅提升。
SIMA 2 的设计目标包括:
- 在多个游戏或虚拟环境中执行复杂任务
- 理解多模态输入
- 通过持续探索提升技能
- 具备一定的推理、规划与上下文理解能力
与传统游戏 AI 最大的区别在于:
它不是为某个游戏定制,而是面向多种 3D 虚拟世界的通用智能体。
二、整合 Gemini 2.5 Flash Lite:推理与规划能力更强
SIMA 2 的能力由 Gemini 2.5 Flash Lite 提供底层支持,这款轻量模型具有:
- 更高效的推理能力
- 快速的环境理解
- 更稳定的任务执行
- 支持多模态输入(语音、图形、界面元素等)
借助 Gemini,SIMA 2 能够:
- 分析复杂场景
- 识别游戏元素和物体
- 理解玩家指令
- 在动态环境中做出行动规划
这让 SIMA 2 的表现比初代更自然、更灵活。
三、任务完成率提升至 62%:接近真实人类玩家水平
官方数据显示,SIMA 2 的任务执行效果大幅提升:
- 任务完成率从约 37% 提升至 62%
- 在部分任务中接近或达到人类玩家表现
- 对复杂指令的理解与执行更稳定
这些任务包括:
- 探索 3D 空间
- 收集物品
- 解决障碍
- 执行多步骤的任务链
- 在未知区域中进行自主探索
这意味着 SIMA 2 已不仅是“能跟随指令”的 AI,而是一个具备一定自主性和问题解决能力的系统。
四、自我改进:AI 自行学习、优化行为策略
DeepMind 为 SIMA 2 加入了 自我改进机制,智能体能通过自身探索的数据不断优化能力。
包括:
1. 自主生成优化样本
SIMA 2 会记录自己失败与成功的行为,并进行自我学习。
2. Genie 3 支持的环境生成
借助 Genie 3 的环境生成能力,AI 可以:
- 生成模拟世界
- 在这些世界中进行训练
- 不断积累更多行为样本
这使得 SIMA 2 能够在无需大量人工标注的情况下自行成长。
五、多模态理解:不仅懂语言,还能理解界面元素
SIMA 2 的多模态能力让它具备高度的交互灵活性。它可以理解:
- 自然语言指令
- 语音指令
- 图形界面与 UI 图标
- 表情符号
- 游戏 HUD 元素
- 任务提示与界面图标
举例:
玩家说“拿起前面的工具然后修理墙壁”,SIMA 2 会:
- 分析语音或文本内容
- 识别画面中的“工具”
- 寻找“墙壁”位置
- 执行修复行为
这种能力为未来的虚拟现实交互打下基础。
六、应用潜力:不仅是游戏 AI,更是未来通用智能的实验场
SIMA 2 所展现的核心价值远不仅限于游戏或虚拟世界。
1. 虚拟助手——从 2D 到 3D 世界的升级
未来虚拟助手或将进入 3D 空间协作,SIMA 2 是其中关键步骤。
2. 数字孪生中的智能体训练
复杂工业流程的虚拟测试可借由 SIMA 能力进行智能自动化。
3. 多场景 AI 行为统一化
同一智能体可在不同世界中执行任务,这对于“通用智能”研究意义重大。
4. 游戏开发与玩家辅助
可成为:
- 智能 NPC
- 游戏教学助手
- 自动化任务伙伴
七、SIMA 2 的意义:朝更高层次智能迈出的重要一步
SIMA 2 的发布体现了:
- AI 逐步从“文本智能”向“环境理解智能”拓展
- 多模态模型在现实场景中的落地正不断推进
- 虚拟世界成为检验通用智能的重要平台
- 自我改进机制将让智能体更快速成长
它不仅是游戏中“能听懂指令的 AI”,更是一个能够适应环境、学习技能、执行任务的通用智能体雏形。










评论区 (0)
最新评论登录后发布评论并参与互动。
暂无评论,欢迎抢沙发。