论文
超越硬预算:更可解释的 Top-k 稀疏自动编码器的稀疏正则化器
Beyond the Hard Budget: Sparsity Regularizers for More Interpretable Top-k Sparse Autoencoders
摘要
稀疏自动编码器 (SAE) 已成为解释视觉基础模型表示的领先工具,将其多语义激活分解为更大的稀疏、更单语义的特征集。 Top-$k$ SAE 是现在的标准变体,通过其激活函数在架构上强制执行稀疏性,仅保留每个输入的 $k$ 最活跃的潜在变量。因为它的设计正是为了避免早期 SAE 使用的 $\ell_1$ 惩罚及其已知的缺点,所以它没有与显式稀疏正则化器相结合。然而,Top-$k$ SAE 保留了其自身的局限性,我们假设在选择之前执行的稀疏性惩罚可以增强每个潜在变量的选择性并使代码更易于解释,而不会重新引入 $\ell_1$ 惩罚的缺点。我们引入了两个与 Top-$k$ 架构兼容的稀疏正则化器,两者都作用于 Top-$k$ 选择之前的激活:对未选择(脱离支持)单元的 $\ell_1$ 惩罚,以及将代码集中到较少有效单元的尺度不变 $\ell_1/\ell_2$ 比率惩罚。这两种惩罚仅适用于批次活跃单元,即由 Top-$k$ 操作员在批次内至少选择一次的单元。在两个数据集、三个视觉基础模型和一系列 $k$ 中,两个正则化器都一致地提高了单语义性,而不影响重建质量。 $\ell_1/\ell_2$ 惩罚进一步将信息集中到更少的潜在变量中,使重建对于 $k$ 的推理时间选择更加稳健,并改进小预算线性探测。我们的中心发现是硬架构稀疏性和软稀疏正则化是互补的而不是相互排斥的。