论文

为什么 后训练 量化有效?

Why Does Post-Training Quantization Work?

模型评测模型行为与机制分析

摘要

后训练 量化通过以降低的精度存储权重来压缩 大语言模型 (LLM),并且每个量化权重都会将误差引入隐藏状态。天真地,这些错误应该随着深度的增加而累积,并破坏下一个词元的预测;随机初始化的模型会快速积累这些差异,而量化的预训练模型会积累更少的隐藏状态错误,并在很大程度上保持下游任务性能,即使它们从未接受过量化噪声训练。这就提出了我们要解决的问题:为什么 后训练 量化有效?比较全精度和量化前向传递,我们确定了两种表征预训练量化鲁棒性的机制。首先,层新引入的误差往往与它从层的输入继承的误差相反。两者部分抵消,使得全精度和量化通道之间的差异缓慢增长。这种抵消残留相互作用是在预训练期间形成的。我们的定量分析将其确定为减缓隐藏错误增长的主要因素。其次,LM-head 几何优先保留高排名标记的分数和概率,它们通常代表模型最有信心的预测。这些机制共同解释了为什么经过多个层的量化误差仍然只能产生很小的输出变化,并且我们跨模型和量化设置验证了结果。