论文

ThinQuant:用于大语言模型权重和激活量化的可扩展旋转学习

ThinQuant: Scalable Rotation Learning for Weight and Activation Quantization of LLMs

摘要

学习旋转通过平滑激活分布中的异常值,在实现大语言模型的低位权重和激活量化方面发挥着重要作用。最先进的方法包括基于梯度的程序(例如 SpinQuant)和计算友好的无梯度方法(例如 DartQuant),但这两种方法仍然难以扩展到最大的架构。为了解决无梯度旋转学习中的计算瓶颈,我们引入了两种提高效率的想法,(i)减少所需校准数据点数量的数据选择程序,以及(ii)精确减少在此减少的校准集上的相关优化。我们的数据选择过程利用了激活凸包的几何结构。利用这个想法,我们证明了精心挑选的校准集,其激活次数比最先进的基于旋转的方法少几个数量级,可以与它们在低位量化设置中的性能相匹配。在这种极端的数据效率下,选定的激活跨越 $r<d$ 的 $r$ 维子空间,使得对 $d\times d$ 旋转的优化相当于优化 Stiefel 流形上的 $d\times r$ 矩阵。我们使用高效的 ADMM 算法来解决这个简化的问题,该算法在每一步迭代地采用稀疏矩阵更新,因此得名 ThinQuant。对于采用 W4A4KV4 量化的 Llama-3-70B,ThinQuant 在 12 分钟内完成整个旋转校准,并实现 WikiText-2 困惑度 5.63,而 DartQuant 需要 111 分钟,困惑度为 7.55。与 SpinQuant 和 DartQuant 不同,ThinQuant 还可以在单​​个 H200 GPU 上扩展到 Llama-3.1-405B,在短短 2 个多小时内完成旋转校准,并在 W4A4 上实现 WikiText-2 困惑度 2.97,而 GPTAQ+QuaRoT 的困惑度为 3.48。