论文

大语言模型 中雅可比引导噪声注入的量化鲁棒性

Jacobian-guided Noise Injection for Quantization Robustness in Large Language Models

摘要

大语言模型 (LLM) 的量化常常受到自注意力机制对离散化误差的敏感性的阻碍。我们认为 softmax 算子是量化稳定性的瓶颈,因为它对异常值和状态相关的雅可比行列式很敏感。我们从理论上确定,抑制雅可比行列式的范数有助于限制量化引起的性能下降。基于此,我们提出了雅可比引导噪声注入,这是一种将零均值高斯噪声注入预注意力 logits 的训练策略,其方差直接源自雅可比 Frobenius 范数。与先前依赖启发式或直接惩罚雅可比的方法不同,我们的方法提供了一种基于局部注意力敏感性来识别最佳噪声方差的方法。我们在 SOTA LLM 架构上评估该方法,该方法表现出比流行的 PTQ 方法更高的鲁棒性。实证分析表明,所提出的方法在 SigLIP 的 ImageNet-1K 上的 Top-1 准确率上获得了高达 +37% 的相对增益,并且在低位量化设置下将 WikiText 上的语言模型的相对困惑度提高了高达 40%,证明了该方法的有效性。