论文
每一次消融都是一剂:平衡力和自我修复的外表
Every Ablation Is a Dose: Counterweights and the Semblance of Self-Repair
摘要
消除语言模型的一个组件,其他组件通常会出现调整和补偿。这种被称为自我修复的现象已被多次观察到,但其机制仍不清楚。迄今为止最系统的研究得出的结论是,自我修复是有噪音的,不太可能有单一的解释。我们认为它有一个:在任何消融之前就已经存在的增益。对因果重要组成部分的任何干预都可以被视为坐标轴 $λ$ 上的一个点,即反事实对比的符号强度。因此,传统的消融方法是该轴上未校准的点。我们证明了细粒度单元 $r$ 的因果修复响应受仿射律 $E_r(λ)=own_r+γ_rλ$ 的约束。斜率 $γ_r$ 是一个固定系数,无论是否有消融,都会持续影响模型,其符号决定该单元是抵消还是增强去除的信号。在来自不同家族(Gemma、Qwen、LLaMA 和 Mistral)的四个模型的事实判决任务中,我们识别了包括 MLP 神经元、OV 神经元和遵循仿射定律的奇异方向在内的组件,总共 81 个下游方向中的 68 个。此外,我们可以从固定权重预测 $γ_r$ 的大小。在GPT-2 Small的IOI电路上,干预所能到达的十个头中,有七个遵循规律,并且所有七个都是配重。从这个角度来看,自我修复可能是当对比信号出现在核心时执行其通常操作的平衡物。