论文
保留解码器的稀疏自动编码器:哪些读数可以承受稀疏压缩?
Decoder-Preserving Sparse Autoencoders: Which Readouts Survive Sparse Compression?
摘要
稀疏自动编码器(SAE)将模型激活压缩为稀疏代码,但相等的重建误差和稀疏性可以保留不同的线性可解码信号。我们将这种模糊性形式化为最优脊预测算子之间的矩阵值失真,并通过将该失真与重建损失相结合来训练解码器保留 SAE。在等级松弛中,各向同性任务先验使每个模式的省略成本饱和而不改变 PCA 的排序,而结构化先验可以改变保留的模式。受控稀疏实验表明,声明的先验可以保护保留的组合免受其任务子空间的影响。在 GPT-2 小块 8 上,DPSAE 在三个配对运行中将保留的解码器失真减少了 10.6--11.4%,同时匹配重建 NMSE。相同的检查点通过了平均自然文本输出 KL 非劣性测试,但一对匹配的 Pythia 对仅限于少数稀疏特征的探针没有显示任何改进。这些结果表明,重建质量并不能决定哪些改装的线性读数能够在稀疏压缩中幸存,并且读数保存与学习更清晰的基准概念或保留每个冻结模型行为不同。