论文
Q-PACE:量化感知训练中的动态精度分配
Q-PACE: Dynamic Precision Allocation for Quantization-Aware Training
摘要
量化感知训练 (QAT) 利用较低精度的算法来降低 LLM 部署的成本,但激进的量化会降低最终模型的性能。常见的补救措施是混合精度训练,其中为某些层分配高精度以保持性能,同时保持成本限制。这种方法需要在训练期间对模型层进行精确分配。我们提供了一种称为 Q-PACE 的新方法,由二阶灵敏度模型组成,该模型将损失增加预测为按每层曲率系数加权的量化噪声 MSE 之和。在训练期间,我们定期使用跨层扰动重新计算这些系数,并重新分配精度。对高达 4B 参数的 LLM 进行预训练和监督微调实验表明,Q-PACE 持续改进了现有的混合精度训练方案,并以低得多的总内存预算实现了可比较的损失。我们进一步发现,量化灵敏度可以通过深度和层类型进行高度预测,并且其在训练期间的稳定性允许不频繁且廉价的重新校准。
