论文

RHO:你的 编码智能体 是一位秘密的机器人专家

RHO: Your Coding Agent is Secretly a Roboticist

智能体系统Agent Harness

摘要

代码即策略 (CaP) 表明,大语言模型 (LLM) 可以通过编写感知、规划和控制原语来编写代码来解决机器人任务。然而,最近的 CaP 系统在测试时依赖于多轮代码生成循环,这对于实时机器人控制通常是不可行的。我们引入了机器人运行框架优化(RHO),这是一种新颖的范例,其中支持工具的 编码智能体 在训练时提出并搜索可解释的神经符号多文件策略存储库(存储库即策略),这些策略存储库组成了这些原语,而不是单个提示、函数或文件。 RHO 通过环境奖励和执行的反射反馈进行搜索,而不是远程操作演示。它可以推广到 LIBERO-PRO 等受干扰的拾放设置,其中 OpenVLA 得分为 0.0%,$π_{0.5}$ 平均得分为 12.83%。使用相同的底层动作原语,RHO 的成功率达到 45.0%,比最强的多轮代理系统高 2.5 倍,比 $π_{0.5}$ 高 3.5 倍。在 Robosuite 上,RHO 创下了 70.0% 的新最高水平,超过了之前使用单轮执行且在部署时无需进行纠正性 LLM 代码编辑的多轮记录 68.29%。当在控制循环中使用 LLM 时,如在 RAI 的 O3DE 基准测试中一样,RHO 优化了已部署代理的提示、工具和控制代码的多文件利用,将保留成功率从 23.5% 提高到 44.3%,挂钟时间减少了 20%,工具调用减少了 27%。