论文

SoftSAE:自适应稀疏自动编码器的动态 Top-K 选择

SoftSAE: Dynamic Top-K Selection for Adaptive Sparse Autoencoders

模型评测模型行为与机制分析

摘要

稀疏自动编码器 (SAE) 已成为机械可解释性的重要工具,有助于分析 大语言模型 (LLM) 和 Vision Transformer (ViTs) 中的内部表示。通过将多语义激活分解为稀疏的单语义特征集,SAE 旨在将神经网络计算转化为人类可理解的概念。然而,诸如 TopK SAE 之类的常见架构依赖于固定的稀疏级别。它们在所有输入中强制执行相同数量的活动特征 (K),忽略现实世界数据的不同复杂性。自然数据通常位于具有不同局部固有维数的流形上,这意味着样本中相关因素的数量可能会发生显着变化。这表明固定的稀疏度水平并不是最佳的。简单的输入可能只需要几个特征,而更复杂的输入则需要更具表现力的表示。因此,使用常数 K 可能会在简单情况下引入噪声,或者在更复杂的情况下错过重要结构。为了解决这个问题,我们提出了 SoftSAE,一种具有动态 Top-K 选择机制的稀疏自动编码器。我们的方法使用可微的 Soft Top-K 算子来学习依赖于输入的稀疏度 k。这允许模型根据每个输入的复杂性来调整活动特征的数量。结果,表示更好地匹配数据的结构,并且解释长度反映了输入中的信息量。实验结果证实,SoftSAE 不仅可以找到有意义的特征,而且可以为每个概念选择正确数量的特征。源代码位于:https://github.com/St0pien/SoftSAE。