论文

将视频模型转变为通用机器人策略

Turning Video Models into Generalist Robot Policies

摘要

视频生成模型已成为一种有前途的机器人技术骨干,能够生成描述跨实施例和环境完成复杂任务的视频。最近的工作提出了机器人基础模型,通过使用动作标记数据微调视频模型来共同预测未来的观察和动作。在本文中,我们测试了另一种方法的局限性:在训练特定于实施例的逆动态模型(IDM)时保持视频规划器不变。这种解耦提供了几个自然的好处:视频规划器保持与实施例无关,可以轻松交换不同的视频模型,而无需重新训练 IDM,并且可以使用现成的自播放数据独立训练 IDM。我们提出了一种闭环视频到动作策略,它将无动作视频世界模型与基于机器人实施例雅可比行列式精心设计的 IDM 相结合。我们证明了我们的 IDM 设计既具有数据效率,又可扩展到高维动作空间。我们的策略,我们创造了视频到具体机器人动作模型(VERA),在模拟和现实世界的基准测试中实现了强大的性能,包括零射击熊猫手臂操纵和 16 自由度 Allegro 手灵巧立方体重新定向。通过将同一视频规划器与不同的特定于实施例的IDM配对,可以在多个实施例中使用相同的视频规划器。我们的结果表明,解耦的视频规划加上忠实的视频到动作转换是实现零镜头、跨实施例和通用机器人控制的可行替代途径。更多结果请访问我们的项目网站:https://vera.csail.mit.edu。