论文
推理为何无法规划:LLM智能体长时程决策的规划视角分析
Why Reasoning Fails to Plan: A Planning-Centric Analysis of Long-Horizon Decision Making in LLM Agents
摘要
基于大语言模型(LLM)的智能体在短时程上展现出强的逐步推理能力,但在长规划时程上常无法维持连贯行为。我们论证,这一失败反映一种根本性错配:逐步推理诱发一种逐步贪心策略,它对短时程足够,却在长时程规划中失效,因为早期动作必须顾及延迟后果。从这一规划中心视角出发,我们在具有显式状态转移与评估信号的确定性、完全结构化环境中研究基于LLM的智能体。我们的分析揭示基于推理的策略的一个核心失败模式:由逐步评分诱发的局部最优选择导致早期短视承诺,这些承诺随时间被系统性放大且难以恢复。我们提出FLARE(Future-aware Lookahead with Reward Estimation),作为未来感知规划的最小实例,在单个模型中强制显式前瞻、价值传播与有限承诺,使下游结果能够影响早期决策。跨多个基准、智能体框架与LLM骨干,FLARE持续改进任务表现与规划层行为,常常使带FLARE的LLaMA-8B胜过采用标准逐步推理的GPT-4o。这些结果确立了推理与规划的明确区分。
