论文

大语言模型的量化退化:信号-噪声视角

Quantization Degradation in Large Language Models: A Signal-Noise Perspective

模型评测模型行为与机制分析

摘要

训练后量化降低了大语言模型的部署成本,但量化模型退化多严重并非仅由位宽决定。我们在多个模型家族上系统研究仅权重的训练后量化,覆盖位宽、量化方法、模型规模与下游任务。我们观察到退化在这些因素间差异显著:4-bit量化通常保持性能,2-bit常造成大范围退化,3-bit时退化明显但随任务类型、量化方法和模型规模显著变化。为解释这种可变性,我们用信噪比(SNR)度量量化对全精度表示的扰动强度。我们将退化追溯到两个相关过程:量化误差如何在单个模块内产生,以及它们如何跨层累积。首先,源SNR分解显示新引入的误差取决于三个因素:权重误差的大小、任务特定信号的强度,以及量化误差与任务特定激活的对齐程度。不同因素以不同方式影响这些成分。其次,跨层传播分析显示这些误差跨层传递时可被衰减、保持或放大,且更大的模型受益于较弱的误差放大。综合来看,这些结果确证量化退化由误差在源头的引入方式及其在网络中的累积方式共同决定。

大语言模型的量化退化:信号-噪声视角:论文配图
图1:各下游基准上的W3保持率与W4到W3保持率下降。行对应所使用的模型与量化方法,列展示按三类任务分组的11个下游基准。a,相对于对应全精度模型去随机化后的W3保持率。b,W4到W3保持率下降,以W4保持率减去W3保持率计算,单位为百分点。在a中,更深的蓝色表示更低的保持率;在b中,更深的蓝色表示更大的下降;b中的橙色单元格表示W3保持率偶尔高于W4。