论文
WinQ:加速围绕鞍点的语言模型的量化感知训练
WinQ: Accelerating Quantization-Aware Training of Language Models Around Saddle Points
摘要
量化感知训练(QAT)被广泛采用,通过使用量化模型的梯度训练全精度权重来量化语言模型。主要瓶颈是其缓慢的收敛和早期的性能平台,特别是低于 4 位宽度。虽然在之前的工作中已经观察到这个问题,但其确切原因仍不清楚。在本文中,我们通过估计损失表面 Hessians 的谱来分析 QAT 的收敛性。我们发现权重收敛到鞍点周围的平坦区域,其中很大一部分 Hessian 特征值既为正又为负。在训练过程中,越来越多的 Hessian 特征值集中在零附近,其大小会减小。在较低的位宽下,Hessian 谱中的特征值的幅度明显较小。为了缓解这些问题,我们提出了一种名为 WinQ 的算法来加速 QAT,其中包括:(1)定期将权重重置为全精度和量化权重的线性插值,减少到量化网格的距离并增加特征值幅度,以及(2)计算噪声注入权重的梯度以正则化 Hessian。大量实验表明,WinQ 在各种量化方法和模型中将 QAT 加速了多达 4 倍。在相同的训练成本下,WinQ 将最先进的 4 位以下量化提高了高达 8.8%。这些结果在具有不同语言模型、量化方法和位宽的 16 种设置中是一致的。