论文
每个缓存条目都赢得了自己的位置:KV缓存压缩的分辨率和覆盖范围的全局分配
Every Cache Entry Earns Its Place: Global Allocation of Resolution and Coverage for KV Cache Compression
摘要
随着大语言模型(LLM)进程上下文越来越长,KV缓存存储和重复访问已经成为主要瓶颈。现有的 KV 缓存压缩方法依赖于预定义的固定压缩规则,并且通常围绕词元驱逐或合并来开发。结果,缓存资源既不能在层、头和上下文槽之间自由流动,也不能联合分配以平衡本地分辨率和信息覆盖范围。因此,我们提出了GraceKV,一种在KV缓存压缩中分配分辨率和覆盖率的全局方法,并将压缩过程表述为固定缓存预算下的全局资源分配问题。 GraceKV将每个layer-KV头槽组合视为一个原子单元并构建原型树。叶子节点对应于 词元级 KV 条目,而每个内部节点使用单个原型来压缩其子节点覆盖的 KV 空间。树中的一组不重叠的节点形成原子单元的表示。添加新树的根可以扩大信息覆盖范围,而分割选定的节点可以提高局部分辨率。所有候选操作在全球范围内竞争共享缓存预算。最后,所有树中保留的节点形成压缩的 KV 缓存。这个过程自适应地决定了缓存资源在全局原子单元之间的分配以及分辨率和覆盖率之间的平衡。 GraceKV不需要额外的训练,整个压缩和推理过程都在GPU上执行。跨不同长上下文任务和压缩比的系统实验表明,GraceKV 在 32 个设置中的 24 个设置中排名第一,并且在高达 128 倍的压缩下仍然保持鲁棒性。这些结果验证了全球预算分配在协调信息覆盖和本地解决方面的有效性。