论文

斩除九头蛇:语言模型中考虑交互的因果回路发现

Slaying the Hydra: Interaction-Aware Circuit Discovery in Language Models

模型评测模型行为与机制分析

摘要

将行为定位到语言模型的各个组件是机制可解释性的核心目标。然而,一次对一个组件进行评分会错过上下文相关的效果:主要组件可能会抑制备份组件的激活,从而导致组件排名出现问题。实际因果关系通过见证变量研究此类交互的结构:提供上下文信息以解决交互项的变量。然而,与见证变量的估计通常需要组合枚举,并且在实践中是不可行的。我们引入了见证变量集成集合效应(WISE),这是一个建立在见证变量机制基础上的因果估计族,同时对原因和见证变量集进行期望以保持计算上的可行性。在此方法的基础上,我们引入了 JuntaLearner,这是一种基于梯度的因果回路发现方法,该方法学习根据组件在不同大小的组件和见证集合中的因果影响对组件进行排名。除了忠实度指标之外,我们还引入了必要性和任务特异性的衡量标准,以及电路识别得分(CRS)来总结跨电路尺寸的每个指标,同时强调小型电路所实现的效果。在规模不断增加的任务和模型中,与所有指标的归因基线相比,JuntaLearner 实现了更高的平均 CRS。由于其成本不会随着候选组件数量的增加而增加,JuntaLearner 可以扩展到大型模型,同时考虑集合级交互并避免一阶近似。

斩除九头蛇:语言模型中考虑交互的因果回路发现的原论文方法或结果图
图 8:一个训练在 Llama-3.1-8B 上运行:算术、自由见证机制、种子 $0$、阶梯 $(142,71,43,21,7)$。顶部:每个候选者跨步骤的包含日志概率,一个点标记绘制它的步骤,垂直规则是梯级结束的位置以及原因。左下:分离裕度,一旦新的梯级开始,就会再次上升。右下:抽签组中每个成员的平均目标,经过平滑处理;边界处的跳跃是 $k$ 的变化。底部:从上一步结转的顶部 $k$ 的份额,这是梯级必须保持在 $0.9$ 之上才能提前结束的数量。