论文

用于机器人持续学习的记忆锚

Memory Anchors for Continual Robot Learning

模型训练持续学习

摘要

在野外部署的机器人策略应该能够不断学习新任务,而不会忘记现有的行为。对抗这种灾难性遗忘的常见方法是使用先前学习的任务数据的重播缓冲区来训练新的任务数据。尽管这个缓冲区通常是从所有先前的经验中随机采样的,但我们表明,这些经验中的一小部分对锚定过去的表现有很大贡献。我们将这些经历称为记忆锚。我们在新任务观察的表示折叠到旧任务观察的表示上的区域中识别出记忆锚点,即使这些任务需要冲突的操作,例如必须以新的方式操作熟悉的对象时。排练该区域的旧数据在防止破坏性覆盖过去的任务知识方面发挥着关键作用,起到了关键的记忆锚的作用。在对缓冲区进行采样之前仅排除 10% 的内存锚点会导致 LIBERO 基准套件上的灾难性遗忘增加 4.5 倍以上。相反,使用记忆锚点丰富重播缓冲区可以将高度冲突的任务遗忘减少 63%,并能够在真实机器人上成功地持续学习两个任务序列。视频和其他可视化效果可在 https://robot-adaptation.github.io/MemoryAnchors 找到