论文
斩除九头蛇:语言模型中考虑交互的因果回路发现
Slaying the Hydra: Interaction-Aware Circuit Discovery in Language Models
摘要
将行为定位到语言模型的各个组件是机制可解释性的核心目标。然而,一次对一个组件进行评分会错过上下文相关的效果:主要组件可能会抑制备份组件的激活,从而导致组件排名出现问题。实际因果关系通过见证变量研究此类交互的结构:提供上下文信息以解决交互项的变量。然而,与见证变量的估计通常需要组合枚举,并且在实践中是不可行的。我们引入了见证变量集成集合效应(WISE),这是一个建立在见证变量机制基础上的因果估计族,同时对原因和见证变量集进行期望以保持计算上的可行性。在此方法的基础上,我们引入了 JuntaLearner,这是一种基于梯度的因果回路发现方法,该方法学习根据组件在不同大小的组件和见证集合中的因果影响对组件进行排名。除了忠实度指标之外,我们还引入了必要性和任务特异性的衡量标准,以及电路识别得分(CRS)来总结跨电路尺寸的每个指标,同时强调小型电路所实现的效果。在规模不断增加的任务和模型中,与所有指标的归因基线相比,JuntaLearner 实现了更高的平均 CRS。由于其成本不会随着候选组件数量的增加而增加,JuntaLearner 可以扩展到大型模型,同时考虑集合级交互并避免一阶近似。
