论文

世界行动模型通过反复生成重播实现持续模仿学习

World Action Models Enable Continual Imitation Learning with Recurrent Generative Replays

模型训练持续学习

摘要

除了预测机器人动作之外,世界动作模型(WAM)还可以生成未来的视觉观察结果。基于这种生成能力,我们提出了循环生成重放(REGEN),这是一种持续模仿学习框架,可以合成伪重放轨迹,使机器人策略能够排练以前学习的任务,而无需存储其原始人类演示。在持续适应过程中,REGEN 递归查询 WAM 以合成仅以先前任务指令和当前任务观察为条件的伪重放轨迹。模拟和现实世界操作设置中的实验表明,相对于顺序 微调,REGEN 可以将灾难性遗忘减少高达 $50\%$,同时接近需要访问真实重放数据的特权体验重放方法的性能。最后,我们分析了限制生成重播的因素,确定长期视觉退化和动作观察不一致是主要瓶颈。我们的结果使 WAM 成为无需存储演示的持续机器人学习的有希望的基础。