论文

经由逐步PDDL仿真的Agentic LLM规划:一项实证表征

Agentic LLM Planning via Step-Wise PDDL Simulation: An Empirical Characterisation

智能体系统智能体互操作协议Agent任务评测MCP

摘要

任务规划——为从初始状态到达成目标而对动作排序的问题——是自主机器人系统的核心能力需求。大型语言模型(LLM)能否作为经典符号方法之外可行的规划器仍是开放问题。我们提出PyPDDLEngine,一个开源的规划领域定义语言(PDDL)仿真引擎,通过Model Context Protocol(MCP)接口将规划操作暴露为LLM工具调用。LLM不预先提交完整的动作序列,而是充当交互式搜索策略,一次选择一个动作,观察每个结果状态,并可以重置重试。我们在102个国际规划竞赛(IPC)Blocksworld实例上、在统一的180秒预算下评估四种方法:作为经典基线的Fast Downward lama-first和seq-sat-lama-2011、直接LLM规划(Claude Haiku 4.5),以及经PyPDDLEngine的Agentic LLM规划。Fast Downward达到85.3%成功率。直接与Agentic LLM方法分别达到63.7%和66.7%,Agentic方法有一致的但适度的三个百分点优势,代价是每个解的token成本高5.7倍。在大多数共同解决的难度块上,尽管seq-sat-lama-2011有迭代质量改进,两种LLM方法都产出更短的计划,这一结果与训练数据回忆而非可泛化规划相一致。这些结果表明,Agentic收益取决于环境反馈的性质。编码Agent受益于编译器错误和测试失败等有外部依据的信号,而PDDL步进反馈是自我评估的,Agent需要在没有外部验证的情况下评估自身进展。

经由逐步PDDL仿真的Agentic LLM规划:一项实证表征
图1:本工作评估的两种LLM规划方法。(a) 直接LLM规划一次性生成完整计划。无效结果会被丢弃,模型被从头重新提示,各次尝试之间没有任何反馈。(b) 智能体式LLM规划每次执行一个动作,PyPDDLEngine在每个动作之后提供逐步的状态反馈,从而在LLM与规划环境之间形成闭环。