论文

Q-PACE:量化感知训练中的动态精度分配

Q-PACE: Dynamic Precision Allocation for Quantization-Aware Training

模型优化模型训练预训练监督微调与指令调优量化

摘要

量化感知训练 (QAT) 利用较低精度的算法来降低 LLM 部署的成本,但激进的量化会降低最终模型的性能。常见的补救措施是混合精度训练,其中为某些层分配高精度以保持性能,同时保持成本限制。这种方法需要在训练期间对模型层进行精确分配。我们提供了一种称为 Q-PACE 的新方法,由二阶灵敏度模型组成,该模型将损失增加预测为按每层曲率系数加权的量化噪声 MSE 之和。在训练期间,我们定期使用跨层扰动重新计算这些系数,并重新分配精度。对高达 4B 参数的 LLM 进行预训练和监督微调实验表明,Q-PACE 持续改进了现有的混合精度训练方案,并以低得多的总内存预算实现了可比较的损失。我们进一步发现,量化灵敏度可以通过深度和层类型进行高度预测,并且其在训练期间的稳定性允许不频繁且廉价的重新校准。

Q-PACE:量化感知训练中的动态精度分配:论文原图
(a) Q-PACE 和 SNIP 6.5 位/参数预算下 4B 模型的最终格式分配(Pan 等人,2026)。两种方法都支持 K 和 V 投影层,Q-PACE 还促进了最后一个块中的 MLP。