论文
主动预算会降低敏感性:诊断和修复 TopK 稀疏自动编码器可靠性
Active Budget Can Kill Sensitivity: Diagnosing and Repairing TopK Sparse Autoencoder Reliability
摘要
稀疏自动编码器 (SAE) 越来越多地扩展到更广泛的词典,以从大语言模型激活中恢复细粒度结构。然而,只有当相同的含义以不同的表面形式表达时,特征仍然是稳定的分析单位,它才对解释有用。我们通过特征敏感性研究 TopK SAE 的可靠性问题。实验表明,缩放选择性地降低了稀有特征的敏感性,而常见特征则保持相对稳定。受控宽度\(\times k\)阶乘实验将主动预算 k 确定为根本原因:退化是由选择边界引起的,而不仅仅是字典宽度引起的。我们将这种失败归因于 TopK 选择的几何形状。活动边距(即到截止点的距离)无需阈值即可预测特征丢失。在这种边缘诊断的指导下,我们引入了成对排名稳定化。我们的方法针对截止时的排序失败,并将稀有特征敏感性提高了 \(8.83\) 个百分点,同时将重建和活动特征覆盖率保持在基线附近。总的来说,我们的结果表明,广泛的 TopK SAE 不仅应该通过重建、稀疏性和特征计数来评估,还应该通过语义变化和边界几何下的特征可靠性来评估,以实现稳定的可解释性。