论文

重建损失的尺度差异会影响大语言模型量化优化

The Devil Is in the Reconstruction Loss Scale: Rethinking Optimization in LLM Quantization

摘要

后训练量化 (PTQ) 方法通常使用顺序量化,将预训练的 LLM 划分为一系列单元(例如,Transformer块),每个阶段量化一个单元。最先进的 PTQ 方法主要是基于学习的,通过梯度下降优化辅助量化参数(例如,缩放因子、旋转矩阵、裁剪阈值和适配器)以最小化重建损失。常见的做法是使用均方误差(MSE)作为重建损失函数,但其引发的优化行为在很大程度上仍未被探索。在这项工作中,我们全面了解顺序量化,并系统地研究优化如何从第一个量化阶段演变到最后一个量化阶段,旨在深入理解基于学习的 PTQ 方案中的优化。通过广泛的实证研究,涵盖基于学习的代表性 PTQ 方法、LLM 系列、模型规模、架构、量化设置和各种任务,我们一致地揭示了优化不平衡:重建损失幅度在不同阶段显着变化,伴随着 MSE 下高度不均匀的梯度幅度和参数更新。我们将损失幅度的跨阶段范围称为重建损失规模,并揭示 MSE 将意外大的重建损失规模转化为高度不均匀的梯度幅度,这反过来又导致跨量化阶段的优化强度不均匀。这一发现提出了改进基于学习的 PTQ 的一般原则:跨阶段的优化强度应与重建损失规模脱钩。理论上,我们表明在样本、通道、词元和元素级别定义的均方根误差 (RMSE) 变体通过隐式梯度归一化自然地实现了这一原理,作为直接替代,其性能显着优于 MSE。