论文
交叉编码器功能之间的交互:紧凑证明的角度
Interactions Between Crosscoder Features: A Compact Proofs Perspective
摘要
稀疏自动编码器 (SAE) 和交叉编码器等字典学习方法试图通过将模型的激活分解为独立的特征来解释模型。因此,特征之间的相互作用会导致重建错误。我们通过紧凑的证明形式化了这种直觉,并做出了五项贡献。首先,我们展示如何使用交叉编码器构建模型性能的紧凑证明。其次,我们表明,该证明中出现的误差项可以自然地解释为交叉编码器特征之间交互的度量,并为多层感知器(MLP)层中的交互项提供显式表达。然后,我们提供了这种新的交互措施的三个应用。在我们的第三个贡献中,我们表明交互项本身可以用作可微的损失惩罚。应用此惩罚,我们可以实现“计算稀疏”交叉编码器,当仅在每个数据点和神经元保留单个特征时,保留 $60\%$ 的 MLP 性能,而标准交叉编码器为 $10\%$。然后,我们证明根据交互度量进行的聚类提供了语义上有意义的特征簇,最后睡眠代理具有显着的交互作用。代码可在 https://github.com/chainik1125/crosscoders-feature-interactions/tree/arxiv 获取。