论文

不止匆匆一瞥:克服KV缓存压缩中的贪心偏差

More Than a Quick Glance: Overcoming the Greedy Bias in KV-Cache Compression

模型推理KV Cache

摘要

虽然大语言模型(LLM)理论上可支持很长的上下文窗口,但其实际部署受限于键值(KV)缓存内存的线性增长。主流压缩策略通过各种剪枝机制来缓解这一问题,却以牺牲语义记忆换取内存效率。在本工作中,我们提出LASER-KV(Layer Accumulated Selection with Exact-LSH Recall),一个旨在测试严格累积预算策略下KV压缩极限的框架。我们偏离标准的固定摘要大小做法,实施由保护除数(n)控制的分块累积策略,从而将压缩效应与滑动窗口伪影分离开来。我们在Babilong基准上的实验显示,以往压缩方法在各种长上下文任务上性能下降15-30%。LASER-KV保持稳定性能,在128k下以最高10%的优势取得更高的准确率。这些发现挑战了注意力分数本身足以充当token效用代理这一流行假设。