论文
使用开权重模型的纯LLM PDDL领域修复
LLM-Only PDDL Domain Repair with Open-Weight Models
摘要
AI规划关注找到能达成指定目标的动作序列。它依赖显式的世界模型,通常以规划领域定义语言(PDDL)表示。一个活跃的研究方向是探究如何检测并修复此类模型中的错误。例如,用户可以提供作为解的正测试计划,以及在执行中失败的非测试计划,自动修复方法随后修改PDDL模型以满足这些约束。本文评估近期的开权重大语言模型以纯LLM方式完成该修复任务的能力。实验显示,符号基线的F1分数为.49,而表现最佳的LLM在高推理力度下达到.87,绝对提升.38。然而,该设置的平均测试通过率仅为.82,在Thoughtful领域降至.06;即使是包含测试轨迹的最佳设置也仅达到.92。因此,当前的开权重模型尚不能保证满足可靠自动模型修复所需的测试约束。