论文
INT2 KV 缓存量化的输出感知旋转
Output-Aware Rotation for INT2 KV-Cache Quantization
摘要
键值 (KV) 缓存已成为长上下文 大语言模型 推理中的主要内存和带宽瓶颈,使得超低位量化变得越来越重要。然而,现有的基于旋转的 INT2 方法在完整的注意力读出之前优化缓存统计或代理错误,即使模型最终受到通过注意力和输出投影 $W_O$ 传播的错误的影响。为了解决这种不匹配问题,我们提出了 \textit{OptR},这是一种输出感知旋转方法,可以最大限度地减少 post-$W_O$ 注意输出错误。 OptR 将 $W_O$ 后注意力输出误差分解为键和值引起的项,并通过完整的 INT2 量化和注意力路径学习每个头的正交校正。 OptR 进一步应用注意力等效的关键重新参数化来减少大的通道偏移,而不改变 softmax 分布。在三个模型和五个推理和编码基准中,OptR 持续改进了 QuaRot 和 OSCAR,并增强了长上下文检索,同时保留了分页 KV 缓存格式,推理开销可以忽略不计。