论文
ReSpinQuant:通过子空间残差旋转近似进行高效分层 LLM 量化
ReSpinQuant: Efficient Layer-Wise LLM Quantization via Subspace Residual Rotation Approximation
摘要
基于旋转的 后训练 量化 (PTQ) 已成为一种有前途的解决方案,用于减轻 大语言模型 (LLM) 量化中的激活异常值。全局旋转方法通过将激活旋转融合到注意力和 FFN 块中来实现推理效率,但由于它们只能在所有层上使用单个可学习的旋转矩阵,因此表达能力有限。为了解决这个问题,出现了分层转换方法,通过局部适应实现了卓越的准确性。然而,逐层方法无法将激活旋转矩阵融合为权重,需要在线计算并导致大量开销。在本文中,我们提出了 ReSpinQuant,这是一种量化框架,它通过利用离线激活旋转融合和使用高效残差子空间旋转的匹配基础来解决此类开销。这种设计协调了逐层适应的高表达性和可忽略的推理开销。对 W4A4 和 W3A3 量化的大量实验表明,ReSpinQuant 实现了最先进的性能,优于全局旋转方法,并以最小的开销与计算成本昂贵的逐层方法的准确性相匹配。