论文

有趣的代理机器人学习

Playful Agentic Robot Learning

模型训练持续学习

摘要

当前的代理机器人系统可以编写可执行的“代码即策略”程序、观察反馈并在多次尝试中修改行为,但它们在很大程度上仍然是任务驱动的:只有在明确的指令之后才能获得可重用的技能。我们研究 Playful Agentic Robot Learning,其中具体化的 编码智能体 使用自主游戏作为下游任务到达之前的持续技能学习阶段。我们介绍 RAT,即专为游戏时技能获取而设计的机器人代理团队。在游戏过程中,RAT 提出新颖但可学习的探索性任务,计划和执行机器人代码策略,验证中间进度,诊断故障,通过密集的步骤级反馈进行重试,并将成功的执行提取到持久的代码技能库中。在测试时,代理会重用这个冻结库中的相关技能来帮助解决新任务。 LIBERO-PRO 和 MolmoSpaces 中的实验表明,与无游戏和随机游戏基线相比,通过游戏学习的技能可以改善保留的下游任务,在 LIBERO-PRO 和 MolmoSpaces 上分别比 CaP-Agent0 提高 20.6 和 17.0 个百分点。此外,通过简单地将学到的技能检索到上下文中,可以将学到的技能插入到其他推理时代码即策略代理中,从而将 RoboSuite 和现实世界的传输分别提高 8.9 和 8.8 个点,而无需微调底层模型。