论文

组件类型,而不是重建误差,预测注意力量化灵敏度

Component Type, Not Reconstruction Error, Predicts Attention Quantization Sensitivity

模型评测模型行为与机制分析

摘要

许多训练后量化 (PTQ) 方法使用分层重建、二阶代理目标或激活感知变换来减少量化引起的误差。该误差信号是否预测量化个体注意力投射的下游功能影响尚未得到直接表征。我们扫描了 9 个开放权重语言模型(1.3B--8B 参数;OPT、GPT-J、LLaMA-1/2/3、Mistral、Qwen 2.5),并在舍入到最近(RTN)下一次量化一个注意力投影,对于 7 个模型,GPTQ 为 3 位和 4 位,记录了 3,808 个不同的重建误差、困惑度变化和每个投影激活加权量化误差测量。我们发现:(1)在给定的组件类型(Q、K、V 或 O)内,在 RTN 下的 36 个案例中,有 27 个案例中,重建误差解释了不到 10% 的困惑敏感性方差,中位数 R^2 = 0.044; (2) 在所有 9 个模型中,组件类型和层身份都解释了比重构误差更多的方差,层身份在 9 个模型中的 7 个中是最强的预测因子,组件类型在其余 2 个模型中最强; (3) 价值 (V) 预测是最常见的主导成分,在九个模型中的七个中占总正 Delta PPL 的 38--51%; (4) RTN 和 GPTQ 之间广泛保留了主导成分(7 个案例中的 5 个); (5) 激活加权量化误差是比 V 投影的重建误差更好的组件内预测器(中值 R^2 为 0.20 与 0.06)。这些发现表明,仅相对权重重建误差不足以实现敏感度感知的位分配,并且 V 投影值得在混合精度方案中专门考虑。