论文
思维链推理的局部因果归因
Local Causal Attribution of Chain-of-Thought Reasoning
摘要
理解语言模型思维过程的因果结构对于透明度和安全性来说都是一个非常重要的问题。在这项工作中,我们通过分析给定的特定思维链轨迹的各个组成部分(称为单元)之间的因果关系,采取局部方法来实现这一目标。我们在这些单元上构建了一个结构因果模型,并将每个单元与生成(后续)输出单元的对数概率相关联。我们的算法称为 AttriCoT,是一种黑盒方法,通过使用 $O(U)$ 前向传递模型来估计结构因果模型中的重要性参数来执行归因,其中 $U$ 是单位数。对 5 个数据集和 4 个推理模型的扰动曲线的评估表明,AttriCoT 产生的归因比其他方法更忠实于模型的行为。归因结果还揭示了模型和领域之间思维结构的显着差异。