论文

SMIXAE:迈向语言模型中的无监督流形发现

SMIXAE: Towards Unsupervised Manifold Discovery in Language Models

模型评测模型行为与机制分析

摘要

稀疏自动编码器(SAE)已被广泛用于分解和解释神经网络激活,特别是 Transformer 语言模型的激活。 SAE 的一个关键问题是它们无法直接对多维特征进行建模。相反,SAE 可能会通过一组独立的方向来平铺这些特征,这些方向必须在 SAE 训练阶段之后组合在一起,从而阻碍了所学特征表示的可发现性和解释。我们通过引入稀疏混合自动编码器(SMIXAE)架构来解决这个问题。根据经验,我们提供的证据表明,SMIXAE 模型在直接学习先前识别的流形结构以及在开源 Gemma 2 2B 和 9B 模型中寻找新颖结构方面都取得了成功。最后,我们讨论了一些局限性并指出了未来工作的领域。