论文

LeapQuant:具有精确循环状态量化的高效线性注意力

LeapQuant: Efficient Linear Attention with Accurate Recurrent State Quantization

摘要

最近的大语言模型越来越多地采用混合设计,用线性注意力取代标准注意力,例如门控 DeltaNet (GDN) 和 Kimi Delta Attention (KDA)。尽管它们将上下文压缩为固定大小的循环状态并大大降低了长上下文处理的成本,但重复读取和更新该状态仍然是主要的推理瓶颈。量化提供了一种降低此成本的自然方法,但由于舍入误差的积累以及状态中异常行和列的存在,可能会显着降低模型质量。为了应对这些挑战,我们提出了 LeapQuant,这是一种免训练方法,可在 8 位循环状态量化下实现近乎无损的性能。首先,为了减轻误差累积,我们提出了每窗口量化,它跳过一个词元窗口并在其结束时仅量化状态一次。在一个窗口内,输出是根据固定的低位状态和高精度缓冲更新来计算的。其次,为了减少每次量化引入的误差,LeapQuant保留了状态最大的异常值作为几个高精度的补偿器词元,它们共享真实词元的更新路径。然后,我们在量化之前平滑剩余的残差,以进一步减少误差。 Qwen、Kimi 和 GLM 模型系列的综合实验表明,LeapQuant 大幅降低了推理过程中的内存和计算成本。它的精度与 FP32 基准相当,在内核级别实现了 2.05--3.70$\times$ 的平均加速,在 NVIDIA B200、RTX PRO 6000 和 RTX 5090 GPU 上实现了 1.47$\times$ 的端到端推理加速。