论文
使用有预测依据的潜在动作世界模型模仿异质演示
Imitation from Heterogeneous Demonstrations using Grounded Latent-Action World Models
摘要
模仿学习已成为学习视觉运动政策的强大范例,但其泛化性和稳定性受到所需示范数据的规模和质量的限制。一个有前途的方向是利用更丰富但异构的数据源,这些数据源的操作空间不同,并且通常完全缺乏操作标签。现有的结合异构数据源的协同训练方法依赖于启发式和手工设计的对齐技术。相反,我们认为动作表征应该以预测为基础:对环境产生相同影响的动作应该共享相同的表征,无论其来源如何。为此,我们通过使用有预测依据的潜在动作世界模型(GLAM)来实例化这一原则,这是一对跨数据源具有共享潜在行动空间的生成模型,其基础是跨数据源一致地预测未来的观察结果。该潜在动作空间用于训练下游行为克隆(BC)策略,该策略将观察结果映射到潜在动作并将其解码回机器人动作,从而为从异构数据中学习提供了范例。根据经验,我们证明 GLAM 成功地学习了一个对齐的潜在动作空间,该空间有助于在有或没有动作标签的情况下跨数据源进行动作传输。在模拟和现实世界中的五个操纵任务中,GLAM 一致的策略显着优于 BC 基线和先前的潜在操作方法,在相同的数据稀缺设置下,任务成功率平均提高了 48%。视频和代码可在 https://viccccciv.github.io/glam/ 获取。