论文

ENPIRE:真实世界中智能体机器人策略自改进

ENPIRE: Agentic Robot Policy Self-Improvement in the Real World

智能体系统Agent Harness

摘要

在真实世界实现灵巧机器人操作严重依赖人类监督与算法工程——这成为追求通用物理智能的核心瓶颈。虽然新兴编码智能体能生成代码自动化算法搜索——但其成功大多局限于数字环境。我们猜想自动化机器人研究所缺的抽象是一个可重复的真实世界策略改进反馈回路:重置场景、执行策略、核验结果、精炼下一迭代。为弥合该缺口——我们介绍ENPIRE——面向编码智能体的测试框架——以四个核心模块实例化该物理反馈例程:用于自动重置与核验的环境模块(EN)、启动策略精炼的策略改进模块(PI)、以一台或多台物理机器人并行运行评估策略的rollout模块(R)——以及编码智能体分析日志、查阅文献、改进训练基础设施与算法代码以解决失败模式的演化模块(E)。该闭环系统把真实世界操作学习转为可控优化过程——在最小化人力投入的同时允许跨训练配方与智能体变体的公平消融。在ENPIRE加持下——前沿编码智能体能自主训练策略——在挑战性灵巧操作任务(整理针盒、扎紧扎带、工具使用)上达到99%成功率——当我们把智能体团队派驻机器人编队时该过程进一步加速。我们的结果提示了部署编码智能体以自主推进物理世界机器人学的实用可扩展路径。

ENPIRE:真实世界中智能体机器人策略自改进:论文配图
图 2:物理自动研究框架 ENPIRE 概述。为了解决现实世界中的灵巧任务,ENPIRE首先使用工具调用来构建一个根据人类反馈自动重置和验证机制的环境。接下来,编码代理调用环境 API 来进行自动研究,并从现实世界的奖励信号中爬升策略的成功率。更多结果请访问 Research.nvidia.com/labs/gear/enpire。