论文

VFold:对称感知跨层值缓存压缩

VFold: Symmetry-Aware Cross-Layer Value Cache Compression

模型推理KV Cache

摘要

虽然缓存键值 (KV) 状态可以加速大型语言模型 (LLM) 解码,但此缓存可以在长上下文长度下主导内存使用。一种解决方案是通过利用层间缓存相似性来压缩该内存。然而,大多数现有技术都需要对LLM进行架构更改,并产生大量开销。在这项工作中,我们提出了一种对称感知值缓存合并策略,该策略可以减少缓存内存,同时避免解码期间有害的性能下降和架构开销。此外,我们还表明,这种方法可以与现有的缓存压缩技术一起使用,与高比率量化或关键缓存修剪相结合,以达到两种方法单独无法达到的压缩率,并且附加成本最小。最终,我们的研究结果揭示了值缓存中未充分利用容量的主要来源,为在内存限制下扩展上下文窗口提供了一个简单但高效的方向。