论文
自然语言到PDDL问题生成的有据评估与修复
Grounded Evaluation and Repair for NL-to-PDDL Problem Generation
摘要
大型语言模型 (LLM) 已显示出将自然语言 (NL) 规划描述转换为 PDDL 问题实例的前景。然而,诸如句法有效性或规划器成功之类的标准评估标准可能会大大高估对所描述任务的忠实度:生成的问题可能是可解析和可解决的,同时歪曲了预期的初始状态、目标、对象结构或优化目标。本文研究了一种端到端的 NL 到 PDDL 管道,该管道结合了 LLM 生成、PDDL 解析检查、规划和验证、域一致性检查器、LLM 批评器和迭代修复。细粒度的修复反馈是根据领域描述、生成的问题、自然语言问题描述和操作诊断构建的。与策划的基准 PDDL 问题描述进行基于参考的比较用于事后基准分析,这些离线检查包括重命名不变的结构匹配和语义等效性,其中提供领域支持。在 Planetarium、AutoPlanBench 和策划的 PDDL~2.1 问题中,结果表明操作成功和基准参考重建可能存在很大差异。结果还表明,结构化修复可能很有用,并且即使操作成功率有所提高,PDDL~2.1 对于参考重建仍然具有挑战性。