论文

SliderQuant:面向LLM的精准训练后量化

SliderQuant: Accurate Post-Training Quantization for LLMs

摘要

本文从一个被忽视的视角研究大语言模型(LLM)的训练后量化(PTQ):给定一个预训练的高精度LLM,主流的顺序量化框架对不同层一视同仁,但在这具有挑战性的位宽设置下这可能并非最优。我们实证研究了不同层的量化对模型精度的影响,观察到:(1) 浅层/深层通常比中间层对量化更敏感;(2) 在浅层/深层中,最敏感的是第一层/最后一层,其量化误差显著大于其他层。这些实证观察表明,LLM不同层的量化设计需要在多个层级上进行,而不是所有层共享单一层级。受此启发,我们提出了一个名为Sliding-layer Quantization(SliderQuant)的新PTQ框架,它依赖于一个简单的自适应滑动量化概念,并由少量可学习参数辅助实现。SliderQuant的基础组件称为层间滑动量化,它包含三种新颖的滑动窗口设计,分别针对浅层、中间层和深层各异的量化敏感性。另一个组件称为层内滑动量化,它利用增量策略对每个窗口进行量化。由此,SliderQuant具备很强的跨层降低量化误差的能力。在基础语言生成、零样本常识推理以及具有挑战性的数学和代码任务上,对多种LLM——包括Llama/Llama2/Llama3/Qwen2.5模型家族、DeepSeek-R1蒸馏模型和大型MoE模型——的大量实验表明,无论是仅权重量化还是权重-激活量化,我们的方法都优于现有PTQ方法(包括最新的使用旋转变换的PTQ方法)。

SliderQuant:面向LLM的精准训练后量化:论文配图
图 1:不同层的量化对模型精度影响的说明:(1) 量化单个层(第一行)和 (2) 量化 Llama2-7B、Llama2-13B 和 Qwen2.5-14B 的前 ll 层(第二行)。在这里,我们选择了 3 种代表性的逐层、逐块和多块量化方法,SmoothQuant、OmniQuant 和 CBQ,并在 WikiText2 上的 4 位权重激活(W4A4)量化下检查它们。在附录中,图E提供了关于Llama3-8B、Qwen2.5-7B和Qwen2.5-32B的更多说明,显示了类似的观察结果。