论文

揭示逻辑推理中的算法演绎电路

Revealing Algorithmic Deductive Circuits for Logical Reasoning

模型评测模型行为与机制分析

摘要

近期研究表明,大语言模型(LLM)在少样本学习设置下,通过引入抽象描述图遍历算法与逐步推理的功能性符号表示,可以获得强大的推理性能。然而,LLM如何仅凭数量有限的示例真正理解每个推理步骤的抽象含义以及整体算法,仍不清楚。本工作旨在定位负责各个推理步骤的注意力头,并刻画它们之间传递信息的类型。我们首先在符号辅助的思维链(CoT)提示框架下,将各组成推理步骤与其对应的token logits对齐。我们的分析表明,引导推理过程的token位置与低置信度分数相关,这种低置信度源于需要满足示例中推理行为模式的约束。随后我们采用因果中介分析技术,识别对这些模式负责的注意力头。此外,我们的发现表明,LLM通过特化的注意力头(约占全部注意力头的3%)为各个子推理任务检索事实性和基于规则的信息,而较高层则主要促进信息整合以及全局推理策略(例如图遍历算法)的涌现,这些策略协调多个中间推理步骤以完成整体任务。

揭示逻辑推理中的算法演绎电路:论文配图
图 2:Llama-3.1-8B-Instruct 模型上各层和注意力头的 AIE 分数分布。在热图中,得分最高的五个头像用绿色矩形突出显示。折线图中,头部角色与热图对齐;每层得分是通过该层中得分最高的前 15% 头的 AIE 得分的平均值来计算的;红色虚线显示最负责规则选择的层。