论文

面向世界动作模型的事件对齐视觉动作推理

Event-Aligned Visual Action Reasoning for World Action Models

应用与实践模型推理智能体系统推理策略与问题分解Agent 环境交互机器人

摘要

世界动作模型(WAM)利用未来视觉预测作为中间推理过程来指导动作生成。然而,现有的 WAM 通常根据预定义的时间间隔构建视觉想象力,而没有明确考虑关键任务交互和连接转换的不同角色。我们认为,有效的视觉预见应该直接与任务相关的交互及其相应的推理需求保持一致。为此,我们引入了一个与事件相关的视觉动作推理框架,该框架围绕交互事件组织视觉动作预测。通过事件对齐的视觉动作监督,WAM 学会在每次想象的部署中生成事件对齐的视觉上下文,更加重视为动作生成提供信息的关键状态变化。这根据潜在的交互动态塑造了视觉推理粒度,围绕任务关键事件进行详细推理,并通过连接转换进行更粗略的进展。此外,我们引入了一个执行有效性头 识别每个预测动作序列的有效部分,避免分块推理期间的冗余动作。实验表明,与 RoboTwin 2.0 的基线和竞争表现相比,DOMINO 成功率提高了 10.26 个百分点。它还可以从 DOMINO 1 级转移到 2 级和 3 级,而无需进行目标级别调整。

面向世界动作模型的事件对齐视觉动作推理:论文原图
图 3:扫描对象演示片段的视觉预测和注意力。 (a) 视频关注最新观察结果。 (b) 情节结果。 (c) 每个显示块的最后预测帧,覆盖有动作注意力。红色框突出显示交互区域。两种方法都从相同的初始观察开始。后面的块遵循每个策略自己的部署,因此同一列中的帧可能不同。