GSQ:通过 Gumbel-Softmax 采样对 LLM 进行高精度低精度标量量化
GSQ: Highly-Accurate Low-Precision Scalar Quantization for LLMs via Gumbel-Softmax Sampling
摘要
量化已成为高效 LLM 部署的标准工具,特别是对于本地推理,模型现在通常以每个参数 2-3 位的速度提供服务。目前最先进的技术分为简单的标量量化技术(例如 GPTQ 或 AWQ)和“第二代”矢量量化或网格量化方法(例如 QTIP、GPTVQ 和 AQLM),前者已得到广泛部署,但精度稳定在每个参数 3-4 位 (bpp),后者推动了精度前沿,但众所周知难以实现和扩展。在本文中,我们询问这个差距是否是根本性的,或者仔细优化的 $\textit{scalar}$ 量化器是否可以恢复大部分差距。我们的答案是肯定的,通过引入 GSQ(Gumbel-Softmax 量化),这是一种 后训练 标量量化方法,该方法使用离散网格的 Gumbel-Softmax 松弛联合学习每坐标网格分配和每组尺度。 GSQ 将松弛的基数与目标位宽机制中可用的少量级别(例如,三元和 3 bpp 分别为 3-8 个级别)相匹配,从而使优化变得易于处理。实际上,在标准 Llama-3.1-8B/70B-Instruct 模型上,GSQ 在 2 位和 3 位处缩小了标量量化与 QTIP 前沿之间的大部分差距,同时使用具有分组量化的对称标量网格,因此与现有标量推理内核保持兼容。我们进一步表明,相同的离散分配优化可以应用于实际的 GGUF K-Quant 检查点:从公开发布的 GGUF 模型开始,GSQ 提高了准确性,同时将结果投影回相同的部署格式。最后,GSQ 可以扩展到万亿级的专家混合模型,例如 Kimi-K2.5,其中矢量量化方法很难应用。源代码可在 https://github.com/IST-DASLab/GSQ 上公开获取。