论文
注意力-注意力头消融何时支持因果主张?投影级混杂、地板效应和匹配控制
When Do Attention-Head Ablations Support Causal Claims? Projection-Level Confounds, Floor Effects, and Matched Controls
摘要
注意力头消融(将一个注意力头置零并测量由此产生的任务表现变化)是推断语言模型的哪些组件对行为负有因果责任的常用方法。我们使用 GPT-2 Small 表明,除非仔细验证干预语义、评估指标和控制,否则这种推理可能很脆弱。 “归零注意力头”的自然后投影实现几乎与校正的预投影消融(Pearson r = 0.057)不相关,并选择完全不相交的前 5 个重要注意力头集合。 我们还表明,二元准确率可能掩盖行为处于下限或接近上限时的效应,而正确词元的对数概率仍保留连续变化。使用发现集/留出集划分和 1,000 个匹配的随机头和层匹配头对照抽样,校正后的每头效应排名在分割之间高度稳定 (Spearman rho = 0.974),并且前 5 个选定的头显着超过两个控制分布 (蒙特卡洛 p = 0.001)。 不过,GPT-2上关于任务特异性的证据并不稳健。在DistilGPT2上的复现保留了干预语义与匹配对照结论。这表明单头消融本身不能支持因果主张;合理解释需要正确的干预位置、未饱和的连续指标以及匹配的留出集对照。