论文
QUASAR:通过损失感知重建降低量化感知训练的损失底限
QUASAR: Lowering the Loss Floor of Quantization-Aware Training with Loss-Aware Reconstruction
摘要
随着 大语言模型 推理转向较低精度,后训练 量化 (PTQ) 变得越来越脆弱,使得量化感知训练 (QAT) 对于保持模型质量至关重要。然而,QAT 使用潜在全精度权重的有损重建来计算损失和代理梯度,同时对潜在权重本身应用更新。这种不匹配可能会导致训练轨迹不佳和损失底线更高。二阶 PTQ 方法通过最小化损失感知重建误差来缓解类似的差距,但对冻结模型执行一次可能需要几个小时;随着权重的变化在整个 QAT 中重复这个过程是不切实际的。我们引入了 QUASAR,一种 QAT 方法,它在训练循环中持续执行轻量级、损失感知重建,以降低损失层并改进生成的低位模型。在每个训练步骤中,QUASAR 使用平方梯度的指数移动平均值作为在线显着性估计,在一小组剪切范围内进行搜索,并通过显着性加权最小二乘法拟合仿射去量化器。我们的分析表明,损失感知重建误差是 QAT 收敛边界中唯一与重建相关的项,并控制最终量化模型的损失,将 QUASAR 的目标确立为原则性优化目标。 QUASAR 仅修改训练过程并支持标准部署格式,包括整数量化和 NVFP4,且没有推理时间变化或开销。在 Qwen3 和 Llama-3.1 中,QUASAR 在 2、3 和 4 位竞争 QAT 方法中实现了最低的保留 KL 散度,在 3 和 4 位时将 KL 减少至少 10%,在 2 位时减少 29%。在 2 位时,与强大的 QAT 和 PTQ 基线相比,它将八项任务的平均准确度提高了 3.5-4.3 个百分点。