论文

重新思考基于补偿的 LLM 量化中的残余误差

Rethinking Residual Errors in Compensation-based LLM Quantization

摘要

基于权重补偿的方法,迭代地应用量化和权重补偿来最小化输出误差,最近在量化 大语言模型 (LLM) 方面取得了显着的成功。代表作 GPTQ 介绍了几种关键技术,使这种迭代方法对于具有数十亿参数的 LLM 变得实用。 GPTAQ 通过引入非对称校准过程扩展了这种方法,该过程将每个量化层的输出与其全精度对应层对齐,并将残差误差纳入权重补偿框架中。在这项工作中,我们重新审视残差误差的公式。我们在现有方法中确定了次优校准目标:在层内校准过程中,它们将量化输出与补偿权重的输出对齐,而不是原始全精度模型的真实输出。因此,我们重新定义了目标,以在每一步将量化模型的输出与全精度模型的原始输出精确对齐。然后,我们发现残差误差不仅源于前一层的输出差异,还源于每层内补偿权重和原始权重之间的差异,我们将其称为“补偿感知误差”。通过继承 GPTAQ 的神经元分解技术,我们可以有效地将这种补偿感知误差合并到权重更新过程中。对各种 LLM 和量化设置的大量实验表明,我们提出的增强功能与 GPTQ 和 GPTAQ 无缝集成,显着提高了它们的量化性能。我们的代码可在 https://github.com/list0830/ResComp 上公开获取。