论文
从求解器反馈到忠实规划:符号规划的多角色强化学习
From Solver Feedback to Faithful Plans: Multi-Role Reinforcement Learning for Symbolic Planning
摘要
可靠的规划需要将自然语言指令转换为可执行的符号规约,但大语言模型在没有昂贵的PDDL标注时依然脆弱,并且可能以语义上不忠实的方式利用求解器的成功。我们研究如何仅使用求解器反馈、无需人工编写的示范来学习忠实的自然语言到PDDL形式化。我们提出一个基于求解器的多角色强化学习框架,其中单个语言模型同时扮演Actor、Judge和Editor三种角色,分别负责生成、验证与修复。Actor提出PDDL规约,Judge提供经求解器校准的质量信号,Editor执行有界的、以诊断条件为前提的细化。在PlanBench上,我们的方法将平均成功率从LLM+P的35.5%提升到70.8%,取得66.3%的忠实成功率,并将语义漂移降至6.4%。这些结果表明,把求解器反馈组织为生成、验证与修复三种角色,能够实现更可扩展、更忠实的无标注符号规划。
