论文

DRQ:以分布鲁棒细化改善低比特LLM量化

When Lower Reconstruction Loss Hurts: Distributionally Robust Refinement for Low-Bit LLM Quantization

摘要

仅权重的训练后量化(PTQ)高度依赖最小化重建损失,以在低精度下保持模型质量。我们发现,最小化该损失所偏好的权重未必在新任务上表现更好。事实上,更低的重建损失甚至可能降低模型在相同校准数据上的表现。分析进一步说明,当输入激活分布变化时,在校准数据上重建损失更低的权重可能比其他权重产生更高损失。受这些观测和分析启发,我们提出分布鲁棒量化(DRQ):一种事后细化过程,最小化一组受约束输入激活分布上的最坏情形重建损失。DRQ在已有量化网格内细化表示量化权重的整数编码,保持量化参数和推理算子不变。广泛实验表明,DRQ能够改善由AWQ、GPTQ、ParoQuant等六种代表性PTQ方法量化的模型,并在稠密和MoE大语言模型上获得收益。结果确立了DRQ作为仅权重量化的通用事后细化框架,可在不增加推理开销的情况下改善下游表现。