论文

面向大语言模型的显著性感知正则化量化校准

Saliency-Aware Regularized Quantization Calibration for Large Language Models

摘要

训练后量化 (PTQ) 是在内存和延迟限制下部署大语言模型 (LLM) 的有效方法。大多数现有的 PTQ 方法通过最小化预定校准数据集上的分层重建误差来确定量化参数,通常通过尺度搜索或基于 Gram 的方法进行优化。然而,从泛化风险的角度来看,仅基于有限或不具代表性的校准数据的经验重建误差的现有PTQ校准目标可能会使量化权重偏离原始权重。这可能会导致泛化风险出现分歧,从而可能降低下游性能。为了解决这个问题,我们提出了\emph{显着性感知正则化量化校准}(SARQC)一个统一的框架,它通过显着性感知正则化项增强了标准 PTQ 目标。该术语鼓励量化权重在校准过程中保持接近原始权重,从而提高推理过程中的泛化能力。 SARQC 无缝集成到现有的 PTQ 流程中,在统一的公式下增强尺度搜索和基于 Gram 的方法。对密集和专家混合大语言模型的广泛实验证明了困惑度和零样本精度的持续改进,并且在推理过程中没有额外的计算开销。

面向大语言模型的显著性感知正则化量化校准
(a) (b) 图 1:我们动机的说明和验证。 (a) 概念说明:较小的 𝔼 X ​ [ ‖ 𝐖 ^ l ​ X − 𝐖 l ​ X ‖ 2 2 ] \mathbb{E}_{X}[\|\widehat{\mathbf{W}}_{l}X-\mathbf{W}_{l}X\|_{2}^{2}] 通常意味着更好的下游性能。普通校准仅最小化重建损失,这会导致重量漂移并降低性能。最佳解决方案在于平衡输出失配和重量漂移的最佳点。 (b) 我们动机的经验证据:对于 W4A16 下 LLaMA2-7B 上的 SARQC-GBS,通过对原始 FP 权重进行适度正则化可以实现最佳下游精度。此处报告了第 4.1 节中描述的八个评估任务的平均准确度。 ℒ recon \mathcal{L}_{\mathrm{recon}} 和 ℒ sar \mathcal{L}_{\mathrm{sar}} 是方程 8 中定义的重构误差和显着性正则化器。重量漂移的可视化见图 4(附录 F.2)。更多详细信息,请参见附录 F.1。