论文
为基于LLM的规划器定位并纠正错误
Localizing and Correcting Errors for LLM-based Planners
摘要
大语言模型(LLM)在数学与编程上展现出强推理能力,但在符号经典规划任务上频繁失败。我们的研究及先前工作表明,LLM生成的规划常违反指令中给出的领域约束(例如穿墙而行)。为解决这一失败,我们提出用局部化上下文学习(L-ICL)演示迭代增强指令:针对特定失败步骤的定向纠正。具体而言,L-ICL识别轨迹中的首个约束违反,并注入一个最小输入-输出示例,给出失败步骤的正确行为。我们提出的L-ICL技术远比显式指令或传统ICL(添加完整问题求解轨迹)以及许多其他基线有效。例如,在8x8网格世界(gridworld)上,L-ICL仅用60个训练示例即以89%的比率产出有效规划,而最佳基线为59%,提升30%。L-ICL在其他领域(网格世界导航、迷宫、Sokoban与BlocksWorld)以及多个LLM架构上同样展现显著改进。
