论文

SelfWAM:用于快速机器人控制的与自身观测对齐的统一世界动作模型

SelfWAM: A Self-Grounded Unified World Action Model for Fast Robot Control

模型训练监督微调与指令调优

摘要

世界行动模型(WAM)通过联合建模行动和未来观察来改进机器人策略学习。然而,仅根据任务提示和观察上下文来调节未来预测存在捕获一般任务进展而不是已执行操作的特定操作结果的风险。我们推出了 SelfWAM,这是一种建立在模态专用 Mixture-of-Transformer (MoT) 架构之上的统一与自身观测对齐的 WAM,该架构可联合预测动作、动作调节的未来 RGB 帧和机器人自我掩模,从而将未来预测基于机器人的可见身体及其动作引起的运动。在联合训练期间,SelfWAM 允许未来的视觉查询关注所演示动作的干净副本,将视频分支转变为特定于动作的结果模型,同时保持快速仅动作推理路径不变。为了将视频学习重点放在与动作相关的视觉变化上,我们使用特定于提示的目标进行未来机器人自我掩模预测,该目标消除了外观细节并提供了一个时间演化与调节动作紧密耦合的目标。干净动作调节和未来自我掩模监督一起使未来的预测更直接地反映所执行的动作如何改变机器人的可见运动和周围场景。 RoboTwin 2.0 和现实世界操纵任务的实验表明,SelfWAM 可以产生对动作更加敏感的未来,并保持快速的策略推理,同时提高策略性能。