论文
EmbodiedRSI:通过假设引导的共同演化持续学习机器人技能
EmbodiedRSI: Active Continual Robot Learning Through Hypothesis-Guided Co-Evolution
摘要
机器人基础模型提供了强大的视觉运动控制,但当物体位置或任务指令发生变化时,它们的性能可能会下降。进一步的改进通常需要对大量机器人数据进行后期培训,而通过远程操作等方法收集这些数据的成本可能很高。 Agentic 安全带可以围绕模型进行调整,但当前的自我进化安全带在决定要进行哪些代码和技能更改时,使用机器人试验的效率很低。我们引入了 EmbodiedRSI,这是一种自我进化的 Agentic 工具,它可以自主决定下一步探索哪里,并将由此产生的物理交互转化为改进的代码和技能。 EmbodiedRSI 通过快慢双系统架构实现这一点,其中竞争代码和技能假设保存在假设图中。信息价值实验选择选择可以区分这些假设的物理实验。他们的结果指导了代码技能共同进化。慢速系统构建分层记忆,奖励记忆学习根据其价值选择有效记忆,以供以后快速系统改进。在 RoboCasa365 上,EmbodiedRSI 的总体成功率达到 77.0%,在 Composite-Unseen 上达到 71.3%,而最佳基线的成功率为 40.1%。 EmbodiedRSI 在 LIBERO-Pro 上的整体成功率也达到了 86.8%。除了基准性能之外,EmbodiedRSI 将零射击转移到现实世界的机器人,在多项具有挑战性的任务中取得了 71.3% 的总体成功率。
