论文

推理为何无法规划:LLM智能体长时程决策的规划视角分析

Why Reasoning Fails to Plan: A Planning-Centric Analysis of Long-Horizon Decision Making in LLM Agents

智能体系统Agent 规划

摘要

基于大语言模型(LLM)的智能体在短时程上展现出强的逐步推理能力,但在长规划时程上常无法维持连贯行为。我们论证,这一失败反映一种根本性错配:逐步推理诱发一种逐步贪心策略,它对短时程足够,却在长时程规划中失效,因为早期动作必须顾及延迟后果。从这一规划中心视角出发,我们在具有显式状态转移与评估信号的确定性、完全结构化环境中研究基于LLM的智能体。我们的分析揭示基于推理的策略的一个核心失败模式:由逐步评分诱发的局部最优选择导致早期短视承诺,这些承诺随时间被系统性放大且难以恢复。我们提出FLARE(Future-aware Lookahead with Reward Estimation),作为未来感知规划的最小实例,在单个模型中强制显式前瞻、价值传播与有限承诺,使下游结果能够影响早期决策。跨多个基准、智能体框架与LLM骨干,FLARE持续改进任务表现与规划层行为,常常使带FLARE的LLaMA-8B胜过采用标准逐步推理的GPT-4o。这些结果确立了推理与规划的明确区分。

推理为何无法规划:LLM智能体长时程决策的规划视角分析
图5:通过 Monte Carlo Tree Search 的 Flare 概览。(a) 规划以滚动时域(receding-horizon)方式进行。在每一步,Flare 扩展候选动作并进行剪枝以提高效率,执行重复模拟,使用轨迹级反馈评估轨迹,将回报反向传播以更新动作价值,并执行价值最高的动作,然后在下一状态重新规划。(b) 在模拟期间,使用 UCB 风格的规则选择动作,以平衡探索与利用。(c) 轨迹级评估通过有界的轨迹记忆进行摊销,该记忆检索并复用相似轨迹的分数以降低评估成本。总体而言,该设计强制显式的前瞻与价值传播,使未来结果能够影响早期决策。