论文

仍然:单次前向传递中的摊销 KV 缓存压缩

Still: Amortized KV Cache Compaction in a Single Forward Pass

模型推理KV Cache

摘要

KV缓存是长视野语言模型部署的内存瓶颈。实际上,可部署的压缩器必须足够轻量级,以便在推理过程中调用,具有足够的表达能力,以在约束下保留上下文,并且可以在整个轨迹上重用。现有的压缩方法仅满足此要求的一部分:选择方法是轻量级的,但受子集限制,而综合方法具有表现力,但依赖于每个上下文的优化。在这里,我们介绍 Still,一个小型的每层感知器,针对冻结的基本模型进行一次训练,在单次前向传递中生成紧凑的键和值。在 Qwen 和 Gemma 模型上,Still 在压缩比从 $8\times$ 到 $200\times$ 以及上下文长度从 $8$k 到 $128$k 的范围内占据了速度质量前沿的有利一边。在长上下文 RULER 网格上,Still 超出最强基线 8--22 点。相同的紧凑缓存还支持自由格式摘要,保留了 HELMET 上的大部分全上下文增益,并赢得了与 KV-Distill 的成对 LongBench 摘要比较。由于压缩是前向传递,Still 可以迭代应用,进入按上下文方法无法实现的长范围状态。我们表明,摊销使得长上下文缓存压缩变得容易处理,而综合则使其压缩状态在极端压缩中非常有用。