论文

广义任务和运动规划问题的编码代理

Coding Agents for Generalized Task and Motion Planning Problems

智能体系统Agent任务评测

摘要

即使具有完全可观测性和以对象为中心的状态,任务和运动规划 (TAMP) 问题仍然很困难,因为离散决策与几何、运动学和动态约束紧密耦合。广义 TAMP 通过利用问题实例之间的规律来减少新实例的规划工作,从而解决了这一难题。然而,现有方法需要大量的 TAMP 特定工程。我们研究编码代理是否可以通过合成跨实例泛化的程序来自动化此过程。给定任务描述和模拟器访问权限,每个代理选择如何与环境交互,同时在固定的综合预算内开发程序。然后程序被冻结并在未见过的实例上进行评估。我们在 KinDER 和 PDDLStream 的 28 个模拟环境中评估了 Claude Code (Opus 5) 和 Codex(GPT-5.6 Sol 和 GPT-6 Astra),对象数量超出了原始基准测试中评估的数量。在所有程序合成方法中,我们在每个 100 个保留实例上评估了 980 个生成的程序,总共 98,000 个评估片段。总体而言,我们发现编码代理在广义 TAMP 方面出人意料地有效:所有三种代理配置的平均成功率都优于手工设计的规划器、一次性生成和基于 LLM 的广义规划基线(在有规划器可用的 16 个环境中,规划器的成功率为 56% 到 95%,而规划器的成功率为 47%)。随着对象数量的增加,代理程序比规划程序保持更高的成功率,平均每个实例使用的计算量要少一个数量级。日志显示代理使用交互来校准物理模型、测试边缘情况和完善策略。我们发布所有代码,包括向代理提供的完整提示。这些发现表明编码剂是广义 TAMP 的强大基线。