论文

PuzzleKV:KV 缓存压缩的按页低秩分解

PuzzleKV: Page-Wise Low-Rank Decomposition for KV Cache Compression

模型推理KV Cache

摘要

大语言模型 (LLM) 中的长上下文推理越来越受到键值 (KV) 缓存所需内存的限制。 KV 缓存压缩通过减少先前词元的存储成本来解决这个问题。在现有方法中,低秩压缩特别有吸引力,因为它以减少的维度表示每个标记。以前的低秩方法通常从模型权重导出固定投影空间,从校准激活构造固定空间,或者在广泛的缓存区域上构造共享基础。此类表示可能无法捕获详细但重要的信息。我们将每个头 KV 缓存划分为固定长度的逻辑页面,并观察各个页面内的大量低秩结构。基于这一观察,我们提出了 PuzzleKV,一种无需训练和校准的方法,它将每个完成的页面视为一个独立的压缩单元。 PuzzleKV 分解每层和 KV 头中的页面,直接计算密集和分解页面的注意力,并在自回归解码期间增量压缩新的合格页面。跨模型、上下文长度和基准的实验证明了 PuzzleKV 在匹配的存储预算下的有效性。 PuzzleKV 的性能约为原始 KV 缓存存储的 60%,在评估的模型和所有基准设置上实现了超过 96% 的 Full KV 性能,在 RULER 上比 Global SVD 有显着的提升,在 LongBench 上具有竞争性的性能。为了实现更激进的压缩比,PuzzleKV 可以进一步与量化相结合,同时仅使用 18.7% 的原始存储即可保留 93% 以上的 Full KV 性能。