论文
以自我为中心的视频联合训练和机器人导航任务演示
Co-training with Ego-centric Video and Demonstration for Robot Navigation Task
摘要
视觉-语言-动作(VLA)模型对于各种机器人任务很有希望,但它们的性能在很大程度上取决于大规模高质量的训练数据,而在真实机器人上收集这些数据既昂贵又耗时。虽然之前的工作已经探索利用以自我为中心的人类视频来增强操作数据集,但由于运动过程中视角的变化,将这种方法应用于移动机器人导航仍然具有挑战性。在本文中,我们提出了一个框架,可将以自我为中心的步行视频转换为移动机器人模仿学习的数据集。所提出的方法从人类视频中估计相机运动并将其转换为与地面移动机器人兼容的动作表示。通过在人类数据集和机器人收集的数据集上联合训练 VLA 模型,该模型比单独使用任一数据源进行训练可以提高语言理解能力并生成更稳健的动作。水果搜索导航任务的实验表明,人类以自我为中心的视频为移动机器人学习提供了有效且可扩展的数据源。