论文

激活去噪:并行与顺序 LLM 量化的鲁棒性

Activation Denoising: A Robustness View on Parallel vs Sequential LLM Quantization

摘要

后训练量化是压缩大语言模型的强大工具。最可扩展的方法并行量化每一层,但量化误差随后通过残余流复合,因为没有层可以纠正其之前各层的误差。顺序量化通过在其前辈已经量化的输出上重新校准每一层来解决这种错误复合问题,产生更强的结果,但代价是串行调度成为大规模的瓶颈。作为一种解决方案,我们提出了带有激活去噪的并行量化,这在保持量化完全并行的同时恢复了大部分顺序优势。我们没有逐层重新校准,而是从鲁棒性的角度出发,将上游误差建模为噪声,通过预处理步骤和度量加权舍入进行正则化,使其具有鲁棒性。这种正则化应用于每一层,形成深度复合平滑度惩罚,抑制量化误差通过模型放大的强度。与量化中常用的正交旋转(必须保留模型的函数)不同,我们将权重乘以更通用的线性变换。我们发现两者是互补的,并且它们的作用是复合的。根据经验,我们的鲁棒性正则化在单次并行传递中以一小部分时间恢复了顺序量化的大部分优势。总的来说,通过将复合量化误差视为鲁棒性问题,我们为更高效、更准确的 LLM 大规模量化提供了原则基础。