论文
剪枝如何重塑特征:权重剪枝语言模型的稀疏自动编码器分析
How Pruning Reshapes Features: Sparse Autoencoder Analysis of Weight-Pruned Language Models
摘要
权重修剪是压缩 大语言模型 的标准技术,但其对学习内部表示的影响仍然知之甚少。我们首次系统地研究了非结构化剪枝如何重塑语言模型的特征几何,使用稀疏自动编码器(SAE)作为可解释性探针。在三个模型家族(Gemma 3 1B、Gemma 2 2B、Llama 3.2 1B)、两种修剪方法(magnitude 和 Wanda)和六个稀疏级别(0--60%)中,我们调查了五个研究问题,涵盖种子稳定性、特征存活、SAE 可转移性、特征脆弱性和因果相关性。我们最引人注目的发现是,罕见的 SAE 特征(那些发射率低的特征)比频繁的特征更能经受修剪,在 17 个实验条件中的 11 个中,条件内 Spearman 相关性为 rho = -1.0。这一反直觉的结果表明,剪枝充当隐式特征选择,优先破坏高频通用特征,同时保留专门的稀有特征。我们进一步表明,Wanda 剪枝保留的特征结构比幅度剪枝好 3.7 倍,预训练的 SAE 在稀疏度高达 50% 的 Wanda 剪枝模型上仍然可行,并且几何特征生存并不能预测因果重要性——与压缩下可解释性的影响相分离。