论文

困惑可能会错过量化下的 SAE 特征损坏

Perplexity Can Miss SAE Feature Damage Under Quantization

摘要

量化是部署 大语言模型 的标准路径,当困惑度或下游精度保持接近全精度原始模型时,量化模型通常被认为是可接受的。但行为奇偶性并不一定意味着特征保真度:用于解释全精度模型的稀疏自动编码器(SAE)特征可能会在权重舍入后发生变化。我们通过使用冻结的 SAE 作为固定测量基础,对相同标记进行全精度和舍入到最近 (RTN) 量化激活进行编码,并通过 Pythia-70M 和 Gemma-2-2B 上从 INT8 到 INT4 位宽的 Pearson 相关性来测量每个特征的生存率,从而直接对此进行测试。我们的主要发现是,困惑度可能会错过特征损坏:在 Gemma-2-2B 上,INT7 改善了困惑度,同时降低了 18.7% 的活动 SAE 特征,而在滑动窗口评估下,INT6 也改善了困惑度,但只有 51.3% 的活动特征幸存下来。特征存活率是分级的,而不是悬崖式的,62.4% 的活跃 Pythia 特征和 51.3% 的活跃 Gemma 特征在 INT6 时存活;大多数未幸存的特征都变得模糊而不是完全损坏。生存率也可以仅通过全精度特征统计来预测,交叉验证的 AUC 0.92--0.97 和峰值激活是最强的边缘预测因子。最后,RTN 量化和匹配困惑度剪枝损害了强烈重叠的特征集,Jaccard 重叠为 0.79--0.86,损害得分 Spearman 相关性为 0.98。这些结果表明,仅行为指标不足以证明全精度可解释性发现转移到量化模型,从而激发了压缩的特征级审计。