论文

Robo-COP:让机器人编排器与动作策略在部署中共同改进

Co-Evolving Robot Orchestrators and Policies through Deployment

智能体系统模型训练应用与实践监督微调与指令调优智能体自我改进机器人

摘要

在大型数据集上训练的视觉语言动作(VLA)策略在其训练领域内是有能力的,但它们仍然无法泛化到机器人在现实世界部署中遇到的各种情况。 Agentic 机器人系统通过视觉语言模型 (VLM) 协调器来补充策略,该协调器学习何时调用策略、如何指示策略以及何时使用脚本技能。然而,由于该工具是围绕语言可操纵性有限的冻结策略构建的,因此编排器可以避免策略的失败,但永远无法克服它们。政策成为整个系统的瓶颈。微调策略可以消除这个瓶颈,但单独更新它会使其与适应其旧行为的协调器脱钩。我们提出了 Robo-COP,其中协调器和策略在部署过程中共同演化。 Robo-COP 通过自己的执行来策划技能演示,当这些数据可以解决反复出现的故障时微调策略,并且只有在提高了所训练的技能后才采用每项新策略。在 10 项模拟 RoboLab 任务中,与采用冻结策略的相同工具相比,Robo-COP 将平均留出任务成功率从 64.8% 提高到 73.8%,而在没有验证的情况下按固定时间表进行微调仅达到 65.8%。在三项现实任务中,Robo-COP 将坚持的成功率从 38.3% 提高到 50.0%。 Robo-COP 将部署变成一个自我改进的飞轮,机器人通过实践来学习,执行中的每一次改进都会为下一轮学习产生更好的数据。视频和代码可在 https://robo-cop.pages.dev/。 获取

Robo-COP:让机器人编排器与动作策略在部署中共同改进:论文原图
图 1:用于改进部署时间的两个耦合循环。内循环通过情节反射来调整Harness。外循环使用收集的经验来更新策略,然后修改内存,以便工具可以重新评估策略的功能。