论文

MVG-WAM:用于机器人操作的多视图几何感知世界动作建模

MVG-WAM: Multiple View Geometry-Aware World-Action Modeling for Robotic Manipulation

摘要

世界动作模型 (WAM) 将视觉动态与动作预测结合起来,将预训练视频模型的丰富先验引入机器人操作中。然而,它们的多视图界面通常平铺图像或连接标记,从而使同步相机之间的几何关系隐式存在。这使得将全局场景上下文与交互所需的局部几何图形连接起来变得更加困难。我们引入了多视图几何感知世界动作模型(MVG-WAM),它将这些观察结果组织为一个物理世界的相关投影,而不是画布上的单独图像。我们的模型将极线约束的全局状态与从同步观测中联合推断的视图索引几何状态结合起来。相机感知路由为每个视频区域提供其相应的几何上下文和共享的全局状态,显式地构建用于动作预测的表示。我们通过多视野的未来深度监督进一步将几何感知表示以公制尺度为基础,而无需在动作rollout期间进行深度解码。 MVG-WAM 在 LIBERO 上实现了 99.1% 的平均成功率,在 RoboTwin 2.0 上实现了 92.07% 的平均成功率,在两个基准测试中都展现了具有竞争力的性能。 Cobot Magic 的真实世界实验进一步证明,在涵盖三项操作任务的 150 次试验中,其成功率为 91.3%。