论文

SPIRAL:通过接地与反思搜索的符号化LLM规划

SPIRAL: Symbolic LLM Planning via Grounded and Reflective Search

智能体系统Agent 规划

摘要

大语言模型(LLM)在需要探索与自我纠错的复杂规划任务上常常表现不佳,因为其线性推理过程难以从早期错误中恢复。虽然蒙特卡洛树搜索(MCTS)等搜索算法可以探索备选方案,但在稀疏奖励引导下往往失效,也未能利用LLM丰富的语义能力。我们提出SPIRAL(Symbolic LLM Planning via Grounded and Reflective Search),一个将由三个专职LLM智能体构成的认知架构嵌入MCTS循环的新框架。SPIRAL的关键贡献是其一体化规划流水线:Planner提出有创造性的下一步动作,Simulator通过预测现实结果为搜索提供接地,Critic通过反思提供稠密奖励信号。这种协同把MCTS从暴力搜索转变为有引导的、可自我纠错的推理过程。在DailyLifeAPIs和HuggingFace数据集上,SPIRAL持续优于默认的思维链规划方法及其他最先进智能体。更重要的是,它大幅超越其他最先进智能体;例如SPIRAL在DailyLifeAPIs上取得83.6%的整体准确率,比次优搜索框架高出超过16个百分点,同时展现出更优的token效率。我们的工作表明,将LLM推理组织为有引导、有反思、有接地的搜索过程,可以带来更鲁棒、更高效的自主规划器。源代码、完整附录和全部实验数据已在官方项目仓库公开以保证可复现性。

SPIRAL:通过接地与反思搜索的符号化LLM规划 配图
图 2:SPIRAL 框架概览,其中三-LLM 符号架构驱动 MCTS 循环。(1) 扩展:Planner 提出新动作(a₂),从当前状态(s₂)扩展搜索。(2) 模拟与反思:Simulator 为该动作提供有据可依的观测(o₃),同时 Critic 生成评估该动作优劣的策略性反思分数(ρ_ref)。(3) 反向传播:利用 Critic 分数计算的复合奖励随后沿树向上传播,以更新节点价值并智能地引导未来的选择。