论文
通过变换编码的视角进行 KV 缓存压缩
KV Cache Compression Through the Lens of Transform Coding
摘要
键值 (KV) 缓存存储来自过去词元的信息,是长上下文推理中的主要内存瓶颈。现有的量化方法通过用较低精度的数据类型统一表示 KV 缓存并设计量化方案来最小化缓存本身的重建误差来解决这个瓶颈,而不考虑该误差如何通过注意力机制传播。我们证明,在白噪声量化模型下,预期的注意力感知失真会分解为跨词元和通道的附加键和值贡献。基于信号处理和率失真理论中的经典工具变换编码和反向注水,我们引入了注意力感知变换编码(AATC),它在校准集上分配比特以最小化注意力感知失真。在 Llama-3.1-8B-Instruct 和 Qwen-2.5-7B-Instruct 上,通过 LongBench、RULER、GSM8K、MMLU-Pro 和 MATH-500 进行评估,我们的方法以大约 $5.8\times$ 的压缩率实现了近乎无损的精度,而每个基线至少在某些设置下会降低。