论文
语言模型表示的统一视角:从填充角色结构到机械可解释性
A Unifying Perspective on Language Model Representations: From Filler-Role Structure to Mechanistic Interpretability
摘要
人们提出了多种解释语言模型的方法,提供对其内部运作的重要见解。然而,不同的方法及其由此产生的见解是相对孤立的:语言模型的底层结构可能是什么,以便它们产生我们所有的解释?在这项工作中,我们建议使用张量积表示(TPR)作为统一假设。 TPR 给出了如何在向量空间中将组合结构表示为填充角色绑定的具体建议。我们从数学和经验上证明,TPR 可以统一几种先前的可解释性方法:加法类比、线性探测、稀疏自动编码器和激活修补。从数学上讲,我们证明这些方法都可以源自 TPR。根据经验,我们将推导应用于一系列不同的模型——从小玩具模型到 LLM——来构造上述每种可解释性方法的实例;这些构建的变体的性能与其标准变体相当。我们认为这项工作是朝着可解释性理想目标迈出的一步:对神经网络本质的统一解释,不仅通过个人观察得到证实,还通过对它们之间联系的解释得到证实。