论文
通过激活引导补偿和正交残差了解 LLM 量化
Understanding LLM Quantization through Activation-Guided Compensation and Orthogonal Residuals
摘要
训练后权重激活量化可降低大型语言模型的内存和推理成本,但激进的 W4A4 量化仍然很困难,因为激活异常值会降低有效量化分辨率。尽管权重优化、通道缩放和正交旋转缓解了这个问题,但它们解决的误差分量及其关系仍不清楚。通过将局部权重激活量化误差精确分解为激活引导权重补偿项和正交残差,我们使用持久通道方式异常值和常规激活量来限制残差。这种分解阐明了哪些误差分量可以通过权重补偿来解决,哪些误差分量需要变换设计。然后,我们使用残差界限得出应用随机哈达玛旋转、符号选择和通道缩放的实用指南。特别是,该分析解释了随机符号如何抑制持续异常值通道之间的相长干扰,对多个符号模式进行采样如何改进变换选择,以及二阶矩平衡如何导致 $L_2$ 缩放规则,同时进一步松弛恢复 SmoothQuant 式 $L_\infty$ 缩放。我们通过八个 Llama 和 Mistral 模型的无反向传播配置来评估这些准则,获得与梯度训练的 SpinQuant 相媲美的性能。