论文
通过顺序激活修补的思想链推理的机制可解释性
Mechanistic Interpretability of Chain-of-Thought Reasoning via Sequential Activation Patching
摘要
大语言模型 (LLM) 在思想链 (CoT) 提示的指导下表现出卓越的解决问题的能力,但这些改进背后的内部机制仍然知之甚少。在这项工作中,我们研究了在生成的推理轨迹中出现与 CoT 相关的因果效应的位置,以及哪些注意力头携带有助于最终答案计算的信号。由于 CoT 推理是在多个生成的词元上展开的,因此单个静态词元位置处的标准激活修补不足以表征这些时间分布的效果。为了解决这个限制,我们引入了一个顺序激活修补框架,该框架可以跟踪跨标记位置的 CoT 条件注意头激活,并使用词性引导分析来聚合它们的效果。我们进一步引入顺序多头修补来评估分布式头集的联合贡献,以及交叉问题和随机激活控制。有针对性的零消融实验表明,所识别的头对于成功生成答案具有重要的功能,并影响多种重叠机制,包括推理轨迹维护、答案锚定、样本目标分离和数值生成。总的来说,我们的结果为与 CoT 条件计算相关的分布式推理支持子电路提供了证据。