论文
训练编排者:LLM智能体端到端PDDL规划的监督方法
Training the Orchestrator: A Supervised Approach to End-to-End PDDL Planning with LLM Agents
摘要
把自然语言规划意图翻译为经验证计划是长期挑战:人们用语言沟通目标——而经典规划器要求形式化PDDL规格。近期智能体框架以在验证器检查的精化回路内编排专门修复智能体池来弥合该缺口——但处于中心的编排者本身是提示的前沿LLM——在每个精化步支付前沿LLM API调用。我们呈现HALO(混合智能体-学习编排器)——从外部验证器认证为终止于有效计划的精化轨迹训练编排者——跨11个PDDL域。HALO把小型QLoRA调优策略与三条针对平凡可判定选择的硬编码规则配对——并在扩展的21智能体动作空间上运作。不同于每步提示前沿LLM或从稀疏片段末奖励学习编排者的方法——我们的关键观察是验证器已提供强引导:每条被接受轨迹都是可证明正确的(状态,智能体)决策序列——可直接用作监督。跨PlanBench、Natural Plan与经典规划基准——HALO在成功率上匹敌或超越GPT-5-mini提示基线——与更强的Gemini-3-Flash提示基线相差三个百分点内——把编排成本降低超一个数量级(对照GPT-5-mini每任务0.18美元到0.004美元——约便宜45倍;较Gemini-3-Flash约便宜15倍)——并把每episode总LLM调用削减40到50%。
