论文

RDKV:用于 KV 缓存联合驱逐和量化的率失真位分配

RDKV: Rate-Distortion Bit Allocation for Joint Eviction and Quantization of the KV Cache

模型推理KV Cache

摘要

大语言模型 (LLM) 在不同的任务中表现出了强大的性能,但它们对长输入上下文的推理受到内存大小和带宽的瓶颈。键值 (KV) 缓存大小随着序列长度线性增长,并且需要在每个解码步骤从片外高带宽内存 (HBM) 重新读取到片上内存,从而导致内存限制推理。现有方法通过逐出或量化来减少缓存,但通常将两者分开处理。在本文中,我们将 KV 缓存压缩视为率失真问题,在该问题下,逐出和量化是同一位分配方案的两个端点。这暴露了联合优化它们的需要,激发了我们的方法 RDKV(速率失真 KV 缓存压缩)。 RDKV 根据压缩在注意力计算中引起的失真得出每个词元或通道的权重。基于这些权重,它为每个词元或通道分配一个从全精度到零位的位宽,由反向注水引导,在预填充阶段后应用一次。在 LongBench、RULER 和 InfiniteBench 上的实验表明,RDKV 平均优于最佳评估基线 9.1%。在 LongBench 上,它恢复了 97.81% 的全缓存精度,而缓存保留率仅为 2.48%。与全缓存 FlashAttention-2 解码相比,它在 128K 上下文长度下实现了 4.5 倍的解码加速和 1.9 倍的峰值内存减少,同时保持了相当的性能。