论文

从LLM推理轨迹提取搜索树揭示短视规划

Extracting Search Trees from LLM Reasoning Traces Reveals Myopic Planning

模型评测模型行为与机制分析

摘要

大语言模型 (LLM),尤其是推理模型,会生成扩展的思维链 (CoT) 推理,其中通常包含对未来结果的明确审议。然而,这种深思熟虑是否构成真正的规划、它的结构如何以及它的哪些方面推动绩效仍然知之甚少。在这项工作中,我们引入了一种新方法,通过从四排棋盘游戏的推理轨迹中提取和量化搜索树来表征 LLM 规划。通过在提取的搜索树上拟合计算模型,我们描述了计划的结构以及它们如何影响移动决策。我们发现LLM的搜索比人类的搜索浅,并且性能是通过搜索广度而不是深度来预测的。最引人注目的是,尽管LLM在其踪迹中扩展了深层节点,但他们的移动选择最好通过完全忽略这些节点的短视模型来解释。我们有选择地修剪 CoT 段落的因果干预研究进一步表明,走法选择主要是由浅节点而不是深层节点驱动的。这些模式与人类规划形成鲜明对比,人类规划的性能主要由深度搜索驱动。总之,我们的研究结果揭示了LLM和人类规划之间的一个关键区别:虽然人类的专业知识是由更深入的搜索驱动的,但LLM并不根据深度前瞻采取行动。这种分离为LLM和人类规划的协调提供了有针对性的指导。更广泛地说,我们的框架提供了一种通用的方法来解释跨战略领域的LLM规划的结构。

从LLM推理轨迹提取搜索树揭示短视规划:论文配图
图 1:游戏设置和搜索树提取。 (A) 四连胜游戏中的棋盘位置示例。两名玩家(黑方和白方)交替在 4 ×\× 9 的棋盘上放置棋子,第一个连续 4 次的玩家获胜。 (B) 任务提示。系统提示描述了四连棋的规则、棋盘表示法(FEN记法)以及棋步提交格式。用户消息提供当前棋盘状态和活跃玩家。 (C) 推理跟踪和移动输出。该模型在提交输出中的最终动作之前会生成 CoT 推理轨迹。在示例推理轨迹中,模型的故意动作以蓝色突出显示,而对手故意的动作以橙色突出显示。 (D) 搜索树提取。 LLM 法官 (GPT-5) 解析推理轨迹以提取所考虑的移动的搜索树。在示例搜索树中,顶部方块显示当前棋盘状态(由棋盘的 FEN 符号表示)。每个圆圈代表模型自己的模拟动作所产生的状态,每个方块代表模拟对手的动作所产生的状态。每个节点内的数字表示相应移动的棋盘坐标(零索引)。所示的搜索树仅供说明之用,与 (A) 中的示例板位置不对应。