论文

EmbodiedRSI:通过假设引导的共同演化持续学习机器人技能

EmbodiedRSI: Active Continual Robot Learning Through Hypothesis-Guided Co-Evolution

智能体系统上下文与知识应用与实践记忆Agent Skills智能体自我改进机器人递归自我改进(RSI)Agent记忆

摘要

机器人基础模型提供了强大的视觉运动控制,但当物体位置或任务指令发生变化时,它们的性能可能会下降。进一步的改进通常需要对大量机器人数据进行后期培训,而通过远程操作等方法收集这些数据的成本可能很高。 Agentic 安全带可以围绕模型进行调整,但当前的自我进化安全带在决定要进行哪些代码和技能更改时,使用机器人试验的效率很低。我们引入了 EmbodiedRSI,这是一种自我进化的 Agentic 工具,它可以自主决定下一步探索哪里,并将由此产生的物理交互转化为改进的代码和技能。 EmbodiedRSI 通过快慢双系统架构实现这一点,其中竞争代码和技能假设保存在假设图中。信息价值实验选择选择可以区分这些假设的物理实验。他们的结果指导了代码技能共同进化。慢速系统构建分层记忆,奖励记忆学习根据其价值选择有效记忆,以供以后快速系统改进。在 RoboCasa365 上,EmbodiedRSI 的总体成功率达到 77.0%,在 Composite-Unseen 上达到 71.3%,而最佳基线的成功率为 40.1%。 EmbodiedRSI 在 LIBERO-Pro 上的整体成功率也达到了 86.8%。除了基准性能之外,EmbodiedRSI 将零射击转移到现实世界的机器人,在多项具有挑战性的任务中取得了 71.3% 的总体成功率。

EmbodiedRSI:通过假设引导的共同演化持续学习机器人技能:论文原图
图 2:EmbodiedRSI 概述。快速系统使用假设图来选择每个物理实验。每个结果都指导联合代码技能更新。慢速系统保留了可以改善以后适应的记忆。