论文
反事实视频生成实现可扩展的人形机器人操作
Counterfactual Video Generation Enables Scalable Humanoid Loco-Manipulation
摘要
通过视觉模仿来教授类人机器人的局部操纵技能,例如携带不同的物体,是通向多面手机器人的一条有希望的道路。然而,收集多样化、高质量的交互视频(例如清晰显示人的全身以及与物体的无遮挡交互的剪辑)对扩展这种方法构成了实际障碍。我们提出了 PRISM,这是一个真实到模拟到真实的框架,它通过将少量真实视频放大到一个大型的、多样化的训练集中来克服这一限制。 PRISM 首先通过视频到视频 (V2V) 生成技术,从一些真实视频示例中生成数百个不同的“反事实”人机交互视频。然后,我们的接触锚定真实到模拟管道会重建人类和物体的运动,将这些不完美的视频数据重新定位到物理上合理的轨迹。这些反事实视频的类内变异性使我们能够训练一个单一的策略,该策略可以推广到每个类别中未见过的对象。我们通过在真实的机器人上部署此策略来演示完整的流程,而无需进行任何现实世界的微调。仅使用机载深度观测,我们的人形机器人就可以在新颖的实例、尺寸和初始配置中拾取、携带和掉落物体,包括盒子、桶、箱子和球。