论文

大语言模型 的统计无损量化

Statistically-Lossless Quantization of Large Language Models

摘要

模型量化对于高效的 大语言模型 部署至关重要,但现有方法存在明显的权衡:GPTQ 和 AWQ 等方法实现了实际压缩,但有损,而无损技术保留了保真度,但缺乏推理加速。本文探讨了统计无损压缩的中间立场,研究了无损对于量化 LLM 意味着什么的三个互补方面。首先,任务无损压缩在自然采样方差内保留了零样本基准精度,并且可以在激进的位宽下实现。其次,我们形式化了更严格的分布无损压缩概念,要求量化模型的下一个词元分布实际上与原始模型没有区别,并提出了预期接受率(EAR),即最佳耦合下的最大词元一致概率,作为可直接解释的保真度度量。例如,EAR >= 0.99 表示 99% 一致。第三,我们证明了伽玛平方方差定律,表明对称量化相对于非对称量化将噪声方差增大了 gamma^2,使得非对称量化成为分布无损保真度的先决条件,但不是任务级保存的先决条件。通过 SLQ(一种具有非对称量化和宽位宽搜索的分层非均匀方法),我们获得了远低于每个参数 4 位的任务无损压缩,根据模型低至 3.3 位,平均每个参数 5-6 位的分布无损压缩,与使用优化内核的 FP16 相比,推理速度提高了 1.7-3.7 倍。源代码可在 [https://github.com/IST-DASLab/SLQ](https://github.com/IST-DASLab/SLQ) 获取。