论文
ReSAE:用于多层 Transformer 干预的残差稀疏自动编码器
ReSAE: Residualized Sparse Autoencoders for Multi-Layer Transformer Interventions
摘要
尽管 Transformer 残差流激活在深度上强耦合,但稀疏自动编码器通常一次训练一层。这给多层干预带来了一个实际问题:不同的分层字典可以花费容量来表示相同的结转信息,并且一次替换多个层可能会产生单层行为无法预测的交互。我们引入了残差稀疏自编码器(ReSAE),它在选定层之间拟合仿射图,并根据无法解释的残差而不是完全激活来训练每个后面的层 SAE。重建通过拟合的仿射链映射回原始激活空间,因此可以使用与普通 SAE 相同的干预方案来评估 ReSAE。在 Pythia-1.4B 和 Gemma-2-9B 上,残差减少了解码器冗余,并改进了大多数测试设置中的稀疏探测和目标扰动。尽管重构的原始激活方差较少,ReSAE 在多层替换下恢复了更多的 Transformer 交叉熵。这种增益在教师强制和在线足够稀疏的情况下最为明显,表明 ReSAE 保留了与模型下游计算最相关的激活组件。这些结果表明,去除线性可预测的跨层结构是多层 SAE 干预措施的一个有用的默认设置。