论文
经由逐步PDDL仿真的Agentic LLM规划:一项实证表征
Agentic LLM Planning via Step-Wise PDDL Simulation: An Empirical Characterisation
摘要
任务规划——为从初始状态到达成目标而对动作排序的问题——是自主机器人系统的核心能力需求。大型语言模型(LLM)能否作为经典符号方法之外可行的规划器仍是开放问题。我们提出PyPDDLEngine,一个开源的规划领域定义语言(PDDL)仿真引擎,通过Model Context Protocol(MCP)接口将规划操作暴露为LLM工具调用。LLM不预先提交完整的动作序列,而是充当交互式搜索策略,一次选择一个动作,观察每个结果状态,并可以重置重试。我们在102个国际规划竞赛(IPC)Blocksworld实例上、在统一的180秒预算下评估四种方法:作为经典基线的Fast Downward lama-first和seq-sat-lama-2011、直接LLM规划(Claude Haiku 4.5),以及经PyPDDLEngine的Agentic LLM规划。Fast Downward达到85.3%成功率。直接与Agentic LLM方法分别达到63.7%和66.7%,Agentic方法有一致的但适度的三个百分点优势,代价是每个解的token成本高5.7倍。在大多数共同解决的难度块上,尽管seq-sat-lama-2011有迭代质量改进,两种LLM方法都产出更短的计划,这一结果与训练数据回忆而非可泛化规划相一致。这些结果表明,Agentic收益取决于环境反馈的性质。编码Agent受益于编译器错误和测试失败等有外部依据的信号,而PDDL步进反馈是自我评估的,Agent需要在没有外部验证的情况下评估自身进展。
