论文

训练编排者:LLM智能体端到端PDDL规划的监督方法

Training the Orchestrator: A Supervised Approach to End-to-End PDDL Planning with LLM Agents

模型训练智能体系统监督微调与指令调优Agent Harness

摘要

把自然语言规划意图翻译为经验证计划是长期挑战:人们用语言沟通目标——而经典规划器要求形式化PDDL规格。近期智能体框架以在验证器检查的精化回路内编排专门修复智能体池来弥合该缺口——但处于中心的编排者本身是提示的前沿LLM——在每个精化步支付前沿LLM API调用。我们呈现HALO(混合智能体-学习编排器)——从外部验证器认证为终止于有效计划的精化轨迹训练编排者——跨11个PDDL域。HALO把小型QLoRA调优策略与三条针对平凡可判定选择的硬编码规则配对——并在扩展的21智能体动作空间上运作。不同于每步提示前沿LLM或从稀疏片段末奖励学习编排者的方法——我们的关键观察是验证器已提供强引导:每条被接受轨迹都是可证明正确的(状态,智能体)决策序列——可直接用作监督。跨PlanBench、Natural Plan与经典规划基准——HALO在成功率上匹敌或超越GPT-5-mini提示基线——与更强的Gemini-3-Flash提示基线相差三个百分点内——把编排成本降低超一个数量级(对照GPT-5-mini每任务0.18美元到0.004美元——约便宜45倍;较Gemini-3-Flash约便宜15倍)——并把每episode总LLM调用削减40到50%。

训练编排者:LLM智能体端到端PDDL规划的监督方法:论文配图
图 1:端到端框架。自然语言规范被转换为草稿 PDDL 对,在循环内迭代细化,直到验证者接受计划;然后该计划被重新翻译成自然语言。三个贡献针对循环中心的协调器:(1)它是一个在验证者接受的轨迹上训练的小型模型,在本地运行; (2)它是硬编码规则和学习策略的混合体; (3)智能体池是从La Malfa等人的智能体集扩展而来。 (2026)(在其发布的代码中实现)到 21,具有确定性计划修复和 PDDL 感知建模代理。 πθ\pi_{\theta}的训练如图2所示。