论文

AffordanceWAM:机器人操作的可供性感知联合世界动作建模

AffordanceWAM: Affordance-Aware Joint World-Action Modeling for Robot Manipulation

模型架构Transformer

摘要

通用的机器人操作需要预测场景将如何演变,识别哪些交互是可行的,并确定如何行动。带有动作标签的机器人视频直接监督控制,但成本高昂且多样性有限,而以自我为中心的人类视频捕捉多种交互,但缺乏机器人动作,并且在体现和外观上有所不同。我们引入了 AffordanceWAM,一种具有可供性感知的生成世界行动模型,它通过标量可供性和可供性热图在生成的未来世界中表示以对象为中心的时空可供性。这种表示将视觉预测基于任务相关对象和交互区域以生成动作,并提供跨人类和机器人视频的共享交互目标。 AffordanceWAM 基于预训练的视频扩散 Transformer 构建,使用单独参数化的世界和动作专家,通过蒙版联合自注意力耦合,在统一的流匹配目标下共同预测未来的 RGB 观察结果、标量可供性场、可供性热图和连续机器人动作。人类视频监督所有三个未来世界流,而机器人轨迹还提供动作监督,从而实现无需人类动作标签或重定向的传输。 RoboCasa、CALVIN ABC$\rightarrow$D 和现实世界操作的实验表明,与仅 RGB 和仅机器人数据基线相比,获得了一致的增益。在固定的机器人监督下,RoboCasa 的性能随着可供性注释的人类视频尺度的增加而单调提高。这些结果支持可供性作为视觉-语言-动作学习和人机迁移的有效界面。