论文
经认证的干预保真度:对机械可解释性中的因果关系进行随时有效、自适应的评估
Certified Interventional Fidelity: Anytime-Valid, Adaptive Evaluation of Causal Claims in Mechanistic Interpretability
摘要
机械可解释性通常通过干预模型来评估解释:交换隐藏状态、修补激活、消融组件或将压缩模型与原始模型进行比较。这些实验通常通过点估计进行总结,尽管可以在评估运行或针对可疑故障进行调整时对其进行监控。这使得很难判断所报告的保真度或修补效应是稳定的因果关系还是有限采样和评估选择的结果。我们引入了介入保真度认证 (CIF),这是用于介入可解释性评估的统计层。 CIF 首先将报告的数量写为因果估计值:对指定输入分布和指定干预分布的有界分数的期望。然后,它提供该估计值的置信区间和任何时间有效的置信序列,包括通过有界混合重要性加权进行自适应干预采样。我们使用 Hoeffding 式序列和方差自适应投注序列实例化 CIF,后者在我们的实验中将认证成本降低了 10-30 倍。在 MNIST 抽象和 GPT-2 Small IOI 电路上,CIF 认证高保真声明,显示何时明显的方法差异不受统计支持,并明确干预分布的敏感性。