论文
面向大语言模型的显著性感知正则化量化校准
Saliency-Aware Regularized Quantization Calibration for Large Language Models
摘要
训练后量化 (PTQ) 是在内存和延迟限制下部署大语言模型 (LLM) 的有效方法。大多数现有的 PTQ 方法通过最小化预定校准数据集上的分层重建误差来确定量化参数,通常通过尺度搜索或基于 Gram 的方法进行优化。然而,从泛化风险的角度来看,仅基于有限或不具代表性的校准数据的经验重建误差的现有PTQ校准目标可能会使量化权重偏离原始权重。这可能会导致泛化风险出现分歧,从而可能降低下游性能。为了解决这个问题,我们提出了\emph{显着性感知正则化量化校准}(SARQC)一个统一的框架,它通过显着性感知正则化项增强了标准 PTQ 目标。该术语鼓励量化权重在校准过程中保持接近原始权重,从而提高推理过程中的泛化能力。 SARQC 无缝集成到现有的 PTQ 流程中,在统一的公式下增强尺度搜索和基于 Gram 的方法。对密集和专家混合大语言模型的广泛实验证明了困惑度和零样本精度的持续改进,并且在推理过程中没有额外的计算开销。
