论文

RUQuant:为 大语言模型 完善均匀量化

RUQuant: Towards Refining Uniform Quantization for Large Language Models

摘要

大语言模型 (LLM) 不断增加的规模和复杂性对部署效率提出了重大挑战,特别是在资源有限的情况下。 后训练 量化 (PTQ) 已成为一种实用的解决方案,无需重新训练即可压缩模型。虽然现有方法专注于权重和激活的均匀量化方案,但由于激活分布的不均匀性质,它们经常遭受严重的精度下降。在这项工作中,我们从基于 Lloyd-Max 最优条件的理论角度重新审视激活量化问题。我们认为核心问题是量化区间内激活的不均匀分布,这导致劳埃德-麦克斯准则下的最佳量化点偏离区间的中点。为了解决这个问题,我们提出了一种两阶段正交变换方法,RUQuant。在第一阶段,激活被分成块。每个块都使用复合正交矩阵映射到均匀采样的目标向量,该矩阵是根据 Householder 反射和吉文斯旋转构造的。在第二阶段,使用 Transformer 输出差异对全局 Householder 反射进行微调,以进一步最小化量化误差。经验结果表明,我们的方法无需模型 微调 即可实现接近最佳的量化性能:对于 13B LLM,RUQuant 使用 W6A6 实现了 99.8% 的全精度精度,使用 W4A4 量化实现了 97%,大约在一分钟内。经过微调的变体可以产生更高的准确性,证明了我们方法的有效性和可扩展性。