论文
论关键点模仿学习的泛化能力、设计选择和局限性
On the Generalization Capabilities, Design Choices and Limitations of Keypoint Imitation Learning
摘要
基于 RGB 的模仿学习需要进行多次演示才能泛化到未见过的物体或场景,从而激发对中间表示的研究,以提高机器人操作的泛化能力。视觉基础模型可以一次性提取关键点来提供这种表示。然而,目前尚不清楚如何将它们最佳地整合到模仿学习中以及它们何时优于替代表示。我们结合了之前关于关键点模仿学习(KIL)的工作方法,并研究了几种设计选择以提供实用指南。通过使用 2000 多个现实世界的展示,我们还评估了 KIL 对未见过的物体和场景变化的泛化能力。 KIL 在五项任务中实现了 75% 的总体成功率,显着优于 RGB 基线 (47%),并与 S2 扩散 (73%) 相当。最后,我们探讨了用于关键点提取的基础模型的局限性,并将 KIL 扩展到具有多个对象实例的任务。我们的结果证实 KIL 是一种数据高效的机器人学习方法,尽管它的性能并不优于替代表示,并且继承了用于关键点提取的基础模型的局限性。所有轨迹采样视频、演示和结果均可在 https://kil-manipulation.github.io/ 上获取。