论文

当剪枝满足可解释性时:在 LLM 中保持稀疏自动编码器的鲁棒性

When Pruning Meets Interpretability: Preserving Sparse Autoencoder Robustness in LLMs

摘要

稀疏自动编码器 (SAE) 广泛用于解释 大语言模型 (LLM) 的内部表示,但它们在事后模型压缩下的可靠性仍然知之甚少。我们对修剪如何影响 SAE 行为进行了系统研究,并从理论上表明,对于固定的 SAE,其影响受扰动能量(一种协方差加权范数)控制。这个观点暴露了幅度剪枝的一个关键限制:通过忽略激活几何,它会扭曲学习的表示空间并降低 SAE 功能。相比之下,Wanda 和 SparseGPT 等激活感知方法隐式控制扰动能量,因此在保留 SAE 行为方面更加稳健。我们进一步揭示了所有修剪方法中一致的结构脆弱性:中间层对修剪的敏感度明显高于早期或晚期层。在这一见解的指导下,我们提出了一种分层稀疏分配策略,在相同的平均剪枝稀疏度下实现更低的困惑度。四种模型架构的实验验证了我们的理论发现。代码可在 https://github.com/osu-srml/sae-robustness-under-pruning/tree/main 上公开获取。