论文
使用 Procrustes 条件联合端到端 Top-K 稀疏自动编码器的交叉种子可解释性
Cross-seed explainability using Procrustes-conditioned Joint End-to-end Top-K Sparse Autoencoders
摘要
我们提出了一种 Procrustes 条件联合端到端 Top-K 稀疏自动编码器(SAE),用于从独立训练的 BERT 模型中提取交叉种子通用特征。交叉种子特征的普遍性是机械可解释性的一个基本挑战:因为字典学习是非凸的,独立训练的网络学习未对齐的特征空间,因此明显相同的特征可能因随机初始化而不同。我们通过在联合 SAE 训练之前计算种子激活空间之间的正交 Procrustes 旋转来解决这个问题,结合 Top-K 稀疏性、端到端下游优化以及基于先前 SAE 文献的辅助死特征复兴损失。通过对三个基准数据集(SST-2、Stanford Politeness、TweetEval Emotion)上的五个独立种子对(十个 BERT 模型)进行评估,我们的完整流程比所有三个数据集上的事后对齐基线产生了更通用的特征(种子上的 Pearson r $\geq$ 0.70)。最低限度的定性分析证实,高度普遍性的特征编码了可解释的社会语言模式。