论文

让代码作为政策再次伟大:前沿Agent编写、调用和发展机器人工具

Make Code as Policy Great Again: Frontier Agents Write, Call, and Evolve Robot Tools

智能体系统Agent 工具调用

摘要

前沿模型可以控制机器人,但通过每一次触及、抓握和撤退进行推理使得操作变得缓慢且需要大量的词元。我们以不同的分工重新审视代码作为策略:模型构建可执行工具,代码处理多阶段运动,模型决定下一步做什么。我们引入了 URAI(通用机器人Agent接口),它将构建机器人工具的编程Agent与在反馈循环中使用它们的执行Agent结合起来。编程Agent根据任务意图编写可重用且特定于任务的工具,并通过执行反馈和人工指导对其进行改进。执行Agent根据当前观察结果选择并参数化这些工具;每个调用在将控制权返回给Agent之前都会在本地运行完整的动作。与将后续决策委托给生成的程序不同,此设计保留了工具执行之间的模型级决策。经过验证的工具修订版在不同事件中持续存在,而无需更新基础模型权重,并且共享的 GUI 和 API 使人类和Agent可以使用相同的工具。在五个 RoboDojo 任务和四个冻结执行Agent中,相对于直接指尖控制,URAI 将总体成功率从 18.0% 提高到 53.0%,其中交换块的增益最大;使用相同的工具,提前编写的程序仅达到 24%,而两个Agent在每次通话后做出决定的效率可达 56%。四个Agent中的三个也以 1.3-1.5 倍的速度完成剧集,同时执行Agent输出词元减少了 1.5-1.7 倍; DeepSeek-V4-Flash的成本几乎没有变化。我们进一步在七个现实世界的 AgileX 双臂任务上评估 URAI,涵盖对象操作、布料折叠和人机交互井字游戏。 URAI 连接了前沿Agent的编码和决策能力,围绕Agent可以调用和修改的可重用工具组织机器人控制。