论文

当归因补丁撒谎时:诊断和二阶纠正

When Attribution Patching Lies: Diagnosis and a Second-Order Correction

模型评测模型行为与机制分析

摘要

机械可解释性的核心目标是确定哪些内部组件因果驱动语言模型的行为。由于这些重要性估计可作为识别电路的证据,因此系统错误可能会导致潜在机制的错误识别。虽然激活补丁提供了金标准的因果度量,但其计算成本在规模上却令人望而却步。相反,从业者依赖于归因修补,这是一种基于梯度的一阶近似,其可靠性仍然知之甚少。在这项工作中,我们描述了这种不可靠性的根源,证明主要误差源于下游网络中的非线性,而不是修补组件的局部曲率。这一见解产生了三个实用工具:(i) 检测不可信估计的可靠性评分,(ii) 量化潜在归因错误指定的误差界限,以及 (iii) Hessian 向量积 (HVP) 校正,只需一次额外的向后传递即可消除前序误差。在对五个模型系列(124M-9B 参数)以及随机标记和自然(名称交换)扰动的评估中,HVP 是唯一在更大范围内可行的二阶校正,其中积分梯度等标准基线在计算上变得令人望而却步。在比较实验中,多步 HVP 变体在计算量显着降低的情况下匹配或超过积分梯度的准确性,优于之前的二阶基线。这些改进可在标准基准测试中实现更高保真度的电路恢复,并支持“屏幕标记修复”工作流程,该工作流程仅针对标记为不可靠的组件进行计算工作。