论文

我们正在恢复机制吗?机械可解释性的客观水平恢复差距

Are We Recovering Mechanisms? Objective-Level Recovery Gaps in Mechanistic Interpretability

模型评测评测方法与指标

摘要

机械可解释性旨在恢复负责模型行为的内部计算。自动电路发现的进展通常被视为搜索问题:更好的归因或优化应该识别更好的机制。这假设评估目标一旦找到更好的电路就可以识别它。我们表明,干预定义的忠实度可能更喜欢同等大小的电路,而该电路不能很好地再现模型的行为,从而产生客观水平的恢复差距。在四个人类参考任务和 InterpBench 中,我们将验证忠实度与固定普通重采样下保留提示的行为进行比较。行为标准与完整模型一致,包括其错误,但大于(我们使用语义准确性)除外。受控参考编辑在没有任何发现算法的情况下揭示了错误排名,并且 EAP、EAP-IG、ACDC 和 Edge-SP 的输出也表现出相同的故障。在重采样下,KL 在人类参考任务中对这些方法中 9.4%-41.2% 的候选对进行了错误排序。我们研究上下文失真作为解释:替换排除的信号会改变保留组件运行的输入。从接收者的完整模型执行中恢复选定的信号可以修复验证和保留提示中发现池中 100 个持久 KL 错误排名中的 96 个。电路及其原始行为分数保持不变。这些发现表明,当目标奖励错误的候选人时,为什么仅靠更好的发现是不够的。