论文

机械可解释性的痛苦:形式视角

The Misery of Mechanistic Interpretability: A Formal Perspective

模型评测评测方法与指标

摘要

机械可解释性已成为理解前沿语言模型的主要视角,因为它们的内部运作非常复杂且本质上是黑匣子。为了深入了解这些模型,可解释替换网络(IRN)在所有层进行训练,通过稀疏激活的神经元暴露可解释的特征。然而,IRN 的忠实度通常仅根据干净数据进行经验评估,我们表明,即使是语义上较小的输入扰动也会翻转主要的 IRN 特征,从而翻转五个开放权重模型系列(GPT-2 小、Gemma 2 2B、Gemma 3 1B、Llama 3.2 1B、R1-Distill-Qwen 1.5B)的主要 IRN 特征,从而翻转人类可理解的解释。我们提出了第一个 IRN 忠诚度的正式验证框架,其中可达性分析证明了对抗场景中忠诚度差距的合理上限。此外,我们表明,IRN 的验证意识训练大大收紧了这一认证界限,恢复了安全审核员可以采取行动的功能级别解释。据我们所知,这些结果共同为大型语言模型的机械可解释性提供了第一个正式保证。