论文
稀疏自动编码器中的特征饥饿作为几何不稳定性
Feature Starvation as Geometric Instability in Sparse Autoencoders
摘要
稀疏自动编码器 (SAE) 用于将 大语言模型 (LLM) 的密集、多语义内部表示分解为可解释的单语义概念。然而,标准的 $\ell_1$ 正则化 SAE 遭受特征匮乏(死亡神经元)和收缩偏差的困扰,通常需要计算成本高昂的启发式重采样和不可微的硬掩蔽方法来绕过这些挑战。我们认为,特征匮乏不仅仅是数据多样性差的经验产物,而且是过度完备字典的基本优化几何病理学:$\ell_1$引起的稀疏编码图不稳定,并且与浅层摊销编码器根本上不对齐。为了解决这种结构不稳定性,我们引入了自适应弹性网络 SAE(AEN-SAE),这是一种基于经典稀疏回归的完全可微架构。 AEN-SAE 将强制强凸性和 Lipschitz 稳定性的 $\ell_2$ 结构项与消除收缩偏差并抑制虚假特征的自适应 $\ell_1$ 重新加权相结合,从而共同控制诱导多面体几何的曲率和相互作用结构。理论上,我们表明 AEN-SAE 产生 Lipschitz 连续稀疏编码图,并在温和的假设下恢复全局特征支持。根据经验,在综合设置和 LLM(Pythia 70M、Llama 3.1 8B)中,AEN-SAE 在无需辅助启发式的情况下减轻了特征匮乏,同时保持了有竞争力的重建能力。