论文

SEPTQ:大语言模型 的简单有效的 后训练 量化范例

SEPTQ: A Simple and Effective Post-Training Quantization Paradigm for Large Language Models

摘要

大语言模型(LLM)在各个领域都表现出了卓越的性能,但它们受到大量计算和存储成本的限制。量化是一种有效的技术,用于压缩模型以适应资源有限的设备,同时保持生成质量,它包含两种主要方法:量化感知训练 (QAT) 和 后训练 量化 (PTQ)。 QAT涉及额外的再训练或微调,因此不可避免地导致较高的训练成本并且不适合LLM。因此,PTQ成为近年来量化方法的研究热点。然而,现有的PTQ方法通常依赖于各种复杂的计算过程,并且在低比特量化设置下会遭受相当大的性能下降。为了缓解上述问题,我们为 LLM 提出了一种简单有效的 后训练 量化范例,名为 SEPTQ。具体来说,SEPTQ首先计算权重矩阵中每个元素的重要性得分,并以静态全局方式确定量化位置。然后利用代表重要位置的掩码矩阵逐列量化和更新相关权重,直到获得合适的量化权重矩阵。与之前的方法相比,SEPTQ将后训练量化过程简化为仅两步,并同时考虑了有效性和效率。在不同量化位级别的一系列模型(从数百万到数十亿)的各种数据集上的实验结果表明,SEPTQ 显着优于其他强基线,尤其是在低位量化场景中。