论文
跟踪神经网络中的等效机制解释
Tracking Equivalent Mechanistic Interpretations Across Neural Networks
摘要
机械可解释性(MI)是解释神经网络的新兴框架。给定一个任务和模型,MI 旨在发现一个简洁的算法过程,一种解释,解释模型对该任务的决策过程。然而,MI 很难扩展和概括。这部分源于两个关键挑战:没有有效解释的精确概念;而且,生成解释通常是一个临时过程。在本文中,我们通过定义和研究解释等价问题来解决这些挑战:确定两个不同的模型是否具有共同的解释,而不需要明确描述该解释是什么。在我们方法的核心,我们提出并形式化了这样的原则:如果模型的所有可能实现也等效,则模型的两种解释是等效的。我们开发了一种算法来估计解释等价性,并对其在基于 Transformer 的模型上的使用进行了案例研究。为了分析我们的算法,我们引入了基于模型表示相似性的解释等价的必要和充分条件。我们提供同时关联模型的算法解释、电路和表示的保证。我们的框架为开发更严格的 MI 评估方法和自动化、可推广的解释发现方法奠定了基础。