论文
哪个大模型最适合把自然语言目标转换为PDDL?
Which LLM is Best for Translating Natural Language Goals to PDDL
摘要
在人类意图与机器执行之间搭桥仍是自动规划的挑战,因为用PDDL等形式语言表达目标限制了非专家使用。本文实证评估当前大语言模型能否可靠地把电子游戏测试员以非正式自然语言编写的测试目标,转换为格式正确且适于经典规划的PDDL目标。我们提出经过精心设计、融合迭代实验经验的提示模板,旨在提高多种先进大模型的准确性与回答连贯性。使用真实领域专用基准,我们系统评估六个当代模型的正确性、速度和错误倾向。所有模型正确率都超过92%,Gemini 2.5 Flash以96%取得最高准确率且误报最少,GPT-4.1则响应最快。尽管有这些进展,不同模型仍存在重要表现差异,语言歧义和领域表示限制偶尔导致失败。分析强调,大模型充当自然语言目标与自动规划流水线之间稳健桥梁的能力虽有显著进步,仍存在缺口。