论文
拟合还不够:极度量化的平滑度 LLM
Fitting Is Not Enough: Smoothness in Extremely Quantized LLMs
摘要
大语言模型 (LLM) 实现了强大的性能,但会产生高昂的部署成本,从而激发了极低比特但有损的量化。现有的量化算法主要致力于提高前向计算的数值精度,以消除性能下降。在本文中,我们证明了极度量化的 LLM 所遭受的系统平滑度下降超出了数值精度损失。通过平滑度代理,我们观察到随着量化位宽的减小,这种退化变得越来越严重。此外,基于序列邻域建模,我们发现量化模型表现出预测邻域内有效词元候选的快速减少,这直接导致解码树稀疏和生成质量下降。为了验证它,我们在 后训练 量化和量化感知训练中引入了一个简单的平滑度保持原理,并证明保持平滑度带来了超出数值精度的额外收益。本文的核心目标是强调平滑度保持作为未来极端量化方法的重要设计考虑因素。代码可在 https://github.com/xuyuzhuang11/FINE 获取。