论文
InfoQuant:塑造低位 LLM 量化的激活分布
InfoQuant: Shaping Activation Distributions for Low-Bit LLM Quantization
摘要
低位激活量化仍然是高效 大语言模型 (LLM) 部署的主要瓶颈。困难不仅在于激活包含异常值,而且在于它们的分布通常与低位均匀量化器匹配不佳。现有的 后训练 量化(PTQ)方法抑制峰值、平衡通道或最小化重建误差,但它们很少指定实际上易于离散化的激活分布。因此,激活可能在数值上显得更平滑,但仍然会产生较大的量化误差,因为量化范围仍然很宽,或者大多数值会崩溃到平均值附近的几个级别。我们将激活变换重新设计为面向量化器的分布设计,并从信息论的角度分析量化误差。我们的分析表明,量化友好的激活应该具有较小的数值范围,并且在该范围内具有足够的分散性。在此分析的指导下,我们提出了 InfoQuant,这是一种免训练方法,采用峰值抑制正交变换 (PSOT) 将激活塑造为更适合量化的分布。我们进一步引入自适应离群标记选择,以提高优化过程中 PSOT 的鲁棒性。在多个 LLM 系列中,InfoQuant 始终优于之前的 PTQ 和端到端训练基线。在 W4A4KV4 下,它平均保留了 97% 的浮点精度,并将 LLaMA-2 13B 性能差距比之前的技术水平缩小了 42%。代码可在 [https://github.com/LLIKKE/InfoQuant](https://github.com/LLIKKE/InfoQuant) 获取