论文
从LLM推理轨迹提取搜索树揭示短视规划
Extracting Search Trees from LLM Reasoning Traces Reveals Myopic Planning
摘要
大语言模型 (LLM),尤其是推理模型,会生成扩展的思维链 (CoT) 推理,其中通常包含对未来结果的明确审议。然而,这种深思熟虑是否构成真正的规划、它的结构如何以及它的哪些方面推动绩效仍然知之甚少。在这项工作中,我们引入了一种新方法,通过从四排棋盘游戏的推理轨迹中提取和量化搜索树来表征 LLM 规划。通过在提取的搜索树上拟合计算模型,我们描述了计划的结构以及它们如何影响移动决策。我们发现LLM的搜索比人类的搜索浅,并且性能是通过搜索广度而不是深度来预测的。最引人注目的是,尽管LLM在其踪迹中扩展了深层节点,但他们的移动选择最好通过完全忽略这些节点的短视模型来解释。我们有选择地修剪 CoT 段落的因果干预研究进一步表明,走法选择主要是由浅节点而不是深层节点驱动的。这些模式与人类规划形成鲜明对比,人类规划的性能主要由深度搜索驱动。总之,我们的研究结果揭示了LLM和人类规划之间的一个关键区别:虽然人类的专业知识是由更深入的搜索驱动的,但LLM并不根据深度前瞻采取行动。这种分离为LLM和人类规划的协调提供了有针对性的指导。更广泛地说,我们的框架提供了一种通用的方法来解释跨战略领域的LLM规划的结构。
