论文
大语言模型的量化退化:信号-噪声视角
Quantization Degradation in Large Language Models: A Signal-Noise Perspective
摘要
训练后量化降低了大语言模型的部署成本,但量化模型退化多严重并非仅由位宽决定。我们在多个模型家族上系统研究仅权重的训练后量化,覆盖位宽、量化方法、模型规模与下游任务。我们观察到退化在这些因素间差异显著:4-bit量化通常保持性能,2-bit常造成大范围退化,3-bit时退化明显但随任务类型、量化方法和模型规模显著变化。为解释这种可变性,我们用信噪比(SNR)度量量化对全精度表示的扰动强度。我们将退化追溯到两个相关过程:量化误差如何在单个模块内产生,以及它们如何跨层累积。首先,源SNR分解显示新引入的误差取决于三个因素:权重误差的大小、任务特定信号的强度,以及量化误差与任务特定激活的对齐程度。不同因素以不同方式影响这些成分。其次,跨层传播分析显示这些误差跨层传递时可被衰减、保持或放大,且更大的模型受益于较弱的误差放大。综合来看,这些结果确证量化退化由误差在源头的引入方式及其在网络中的累积方式共同决定。
