论文
了解量化感知训练:量化权重偏差到低损耗盆地的梯度
Understanding Quantization-Aware Training: Gradients at Quantized Weights Bias to the Low-Loss Basin
摘要
后训练 量化 (PTQ) 将经过训练的全精度模型转换为低位权重,而无需任务级重新训练,而量化感知训练 (QAT) 将量化纳入训练循环。尽管 PTQ 在中等位宽下非常高效且通常准确,但在激进的位宽下它可能会急剧失败。 QAT 更昂贵,但通常可以恢复损失的准确性。我们提出了一个统一的几何框架来解释 PTQ 失败和 QAT 恢复。我们将全精度训练建模为在更宽的 \emph{valley} 内遵循低损耗 \emph{river}:河流的正常邻域形成几乎平坦的 \emph{basin},而离开该盆地会导致损失急剧增加。当量化网格与盆地宽度相当时,局部 PTQ 目标(包括舍入和基于 Hessian 的二阶重建)可以选择盆地外部的高损耗部署量化点,即使附近存在低损耗量化点。在这种情况下,基于直通估计器的 QAT 有一个有用的偏差:它评估已部署的量化权重的梯度,同时更新潜在的全精度权重,使梯度感知谷壁并获取向内分量,引导后续量化迭代返回盆地。我们通过局部景观模型形式化了该机制,构建了几何 PTQ 故障模式,并在局部量化器兼容性假设下证明了有限时间 QAT 恢复。多种神经网络量化方案下的视觉和语言模型实验证实了 PTQ 预测的跨盆失败和 QAT 相应的恢复机制。