论文
RACaP:代理推理、行动和编码作为可进化机器人学习的策略
RACaP: Agentic Reasoning, Acting, and Coding as Policies for Evolvable Robot Learning
摘要
通用机器人代理必须从经验中学习、转移到新任务并高效行动。代码即策略 (CaP) 方法在运行时生成和修复程序,从而导致延迟并使可重用机制与特定于任务的决策纠缠在一起。我们引入了 RACaP,这是一个代理框架,它将编码转向演进,并使用推理与行动 (ReAct) 循环在部署时调用冻结的类型化策略 API。两阶段策略将能力课程学习与自主自我进化相结合,以改进 API、ReAct 工具和经验记忆。 API 对可重用的物理机制进行编码,同时公开运行时适应的参数。 ReAct 结合了特定任务的工作记忆、长期经验记忆和视觉反馈来选择操作、验证结果并从故障中恢复,而无需修改源代码。 RACaP 在 LIBERO-90 上取得了 54.4% 的成功率,在零样本 LIBERO-PRO 上取得了 45.0% 的成功率,在 LIBERO-Long 上取得了 46.0% 的成功率,而长视野任务上的 CaP 基线最多只能取得 4.0% 的成功率。在 LIBERO-PRO 上,它的成功率是 CaP 基线的 2.5 倍,中位政策时间加快了 1.9 倍。为了实现高效的机器人部署,拒绝采样微调将 GPT-5.6 ReAct 决策提取到 Qwen3-VL-8B-Instruct 中,使每个决策的推理速度提高了 13.2 倍,并将重复的物理调用从 16 次减少到 4 次。这些结果表明,将可重用代码与运行时决策分离支持持续演进、有效传输和高效的长期控制。