论文
GRKV:长上下文 LLM 中 无需训练 KV 缓存压缩的全局回归
GRKV: Global Regression for Training-Free KV Cache Compression in Long-Context LLMs
摘要
具有扩展上下文长度的 大语言模型 (LLM) 依靠键值 (KV) 缓存来支持对先前词元的关注。然而,维护 KV 缓存会产生大量内存开销,这促使 KV 缓存压缩方法通过逐出和合并来强制执行固定预算。现代逐出方法越来越多地采用基于跨度的保留,因为保留连续的跨度在经验上是有效的,并且可以更好地保持语义一致性。然而,当与驱逐后合并相结合时,基于跨度的保留集中合并到一小组跨度边界载体词元上,产生高度不平衡的合并模式,加剧过度合并并增加信息丢失。为了解决这种不平衡问题,我们提出了 GRKV(KV 缓存全局回归),这是一种 无需训练 KV 缓存合并方法,可直接最小化压缩缓存和全缓存注意输出之间的差异。 GRKV 使用基于岭回归的合并步骤将已逐出的词元中的信息分布到保留的词元中,同时规范更新以防止过度平滑。在 LongBench 和 RULER 长上下文基准测试中,GRKV 是唯一能够以最小的开销提高整体性能的合并方法。我们的代码可在 https://github.com/pjunjie/GRKV 获取。