论文
WM-DAgger:利用世界模型实现模仿学习的高效数据聚合
WM-DAgger: Enabling Efficient Data Aggregation for Imitation Learning with World Models
摘要
模仿学习是训练机器人策略的强大范例,但其性能受到复合错误的限制:微小的策略不准确可能会导致机器人进入训练集中看不见的分布外(OOD)状态,在这种状态下,策略可能会产生更大的错误,导致最终失败。虽然数据聚合(DAgger)框架试图解决这个问题,但它对持续人类参与的依赖严重限制了可扩展性。在本文中,我们提出了 WM-DAgger,这是一种高效的数据聚合框架,它利用世界模型来合成 OOD 恢复数据,而无需人工参与。具体来说,我们专注于使用手眼机械臂进行操作任务,并且仅进行少量演示。为了避免合成误导性数据并克服世界模型固有的幻觉问题,我们的框架引入了两个关键机制:(1)纠正动作合成模块,生成面向任务的恢复动作以防止误导性监督;(2)一致性引导过滤模块,通过将终端合成帧锚定到专家演示中相应的真实帧来丢弃物理上不可信的轨迹。我们在多个现实世界的机器人任务上广泛验证了 WM-DAgger。结果表明,我们的方法显着提高了成功率,仅经过五次演示,就实现了 93.3% 的软包推送成功率。源代码可在 https://github.com/czs12354-xxdbd/WM-Dagger 上公开获取。