论文
通过屏蔽正则化提高稀疏自编码器的鲁棒性
Improving Robustness In Sparse Autoencoders via Masked Regularization
摘要
稀疏自动编码器 (SAE) 广泛用于机械可解释性,以将 LLM 激活投影到稀疏潜在空间上。然而,稀疏性本身并不能完美地代表可解释性,并且当前的训练目标通常会导致脆弱的潜在表示。众所周知,SAE 容易出现特征吸收,即由于共现,一般特征被更具体的特征所包含,尽管重建保真度很高,但仍降低了可解释性。最近关于分布外(OOD)性能的负面结果进一步强调了与未指定的训练目标相关的更广泛的鲁棒性相关故障。我们通过提出基于掩码的正则化来解决这个问题,该正则化在训练期间随机替换标记以破坏共现模式。这提高了 SAE 架构的鲁棒性和稀疏性水平,减少了吸收,增强了探测性能,并缩小了 OOD 差距。我们的结果为更可靠的可解释性工具指明了一条实用之路。