论文
SliderQuant:面向LLM的精准训练后量化
SliderQuant: Accurate Post-Training Quantization for LLMs
摘要
本文从一个被忽视的视角研究大语言模型(LLM)的训练后量化(PTQ):给定一个预训练的高精度LLM,主流的顺序量化框架对不同层一视同仁,但在这具有挑战性的位宽设置下这可能并非最优。我们实证研究了不同层的量化对模型精度的影响,观察到:(1) 浅层/深层通常比中间层对量化更敏感;(2) 在浅层/深层中,最敏感的是第一层/最后一层,其量化误差显著大于其他层。这些实证观察表明,LLM不同层的量化设计需要在多个层级上进行,而不是所有层共享单一层级。受此启发,我们提出了一个名为Sliding-layer Quantization(SliderQuant)的新PTQ框架,它依赖于一个简单的自适应滑动量化概念,并由少量可学习参数辅助实现。SliderQuant的基础组件称为层间滑动量化,它包含三种新颖的滑动窗口设计,分别针对浅层、中间层和深层各异的量化敏感性。另一个组件称为层内滑动量化,它利用增量策略对每个窗口进行量化。由此,SliderQuant具备很强的跨层降低量化误差的能力。在基础语言生成、零样本常识推理以及具有挑战性的数学和代码任务上,对多种LLM——包括Llama/Llama2/Llama3/Qwen2.5模型家族、DeepSeek-R1蒸馏模型和大型MoE模型——的大量实验表明,无论是仅权重量化还是权重-激活量化,我们的方法都优于现有PTQ方法(包括最新的使用旋转变换的PTQ方法)。
