论文

SGG-ReflAct:具有结构化规划的子目标引导 ReflAct,用于可靠的长期推理

SGG-ReflAct: Sub-Goal Guided ReflAct with Structured Planning for Reliable Long-Horizon Reasoning

智能体系统Agent 规划

摘要

推理主干的最新进展使大语言模型(LLM)Agent能够处理复杂的多步骤任务。然而,随着推理视野的增长,不一致的内部信念会导致中间错误,导致Agent偏离他们的目标。这种限制在 REFLACT 中也存在,它仅反映每个步骤的最终目标,而没有明确考虑中间子目标。为了解决这个问题,我们提出了 SGG-ReflAct(子目标引导 Re flAct),这是一种推理主干,它将通过单路径 LLM 规划器生成的子目标集成到反射过程中。我们进一步将此框架扩展到 BeamSGG-ReflAct,它将单路径规划器替换为基于波束搜索的 LLM 规划器,以进行结构化规划探索。我们使用多个 LLM 模型在 ALF World、ScienceWorld 和 Jericho 上进行实验。 SGG-ReflAct 几乎在所有设置中都优于 REFLACT,在 ALFWorld 上使用 Llama-3.1-8B-Instruct 实现了 14.9 个百分点的最佳成功率增益,在 ScienceWorld 上实现了 8.0 个百分点的最佳成功率增益。我们的实验分析表明,SGG-ReflAct 减少了幻觉行为,并在程序排序任务上取得了最大的收益。此外,BeamSGG-ReflAct 的实验结果表明,骨干网的有效性取决于计划质量:明确指定所需的操作可以恢复单独计划搜索无法实现的收益。这些结果表明,SGG-ReflAct 提供了实用且高效的推理支柱,使 LLM Agent能够通过轻松集成在复杂、长期的任务中实现可靠的性能。