论文

ContactFlow:跨实施例传输的视频动作调节

ContactFlow: A video action conditioning that transfers across embodiments

摘要

世界模型通过使代理能够在执行之前想象和验证行动的后果,为机器人规划提供了一条有希望的途径。然而,当前基于视频的世界模型常常难以捕捉控制操纵的物理约束,特别是接触。此外,它们的动作调节通常受限于特定实施例,例如平行夹具。我们提出 \emph{Contact Flow},一种与具体实施方式无关的动作表示,它通过演员和目标对象之间的 3D 接触点轨迹对操作进行编码。通过放弃特定于演员的外观和运动学,Contact Flow 为人类演示和机器人执行提供了共享的调节信号。因此,我们可以在以接触流为条件的人类和机器人对象交互视频上训练大规模视频生成模型,产生一个预测物理上合理的操作结果的世界模型。我们将该模型集成到“提议-想象-验证-行动”管道中,其中生成的预测轨迹在执行前由视觉语言模型进行评估。 DROID 数据集和现实世界桌面操作任务的实验表明,Contact Flow 能够实现人类演示和不同机器人实施例之间的传输。