论文
EchoPress:通过虚拟上下文重建进行与查询无关的 KV 缓存修剪
EchoPress: Query-Agnostic KV Cache Pruning via Virtual Context Reconstruction
摘要
KV 缓存修剪通过驱逐不太重要的键值对来减少长上下文推理内存的使用。 KVzip 通过上下文重建来估计重要性:提示模型逐块重复上下文。这以额外的前向传递为代价实现了强大的压缩质量。学习的近似可以降低这种成本,但需要特定于模型的训练。我们分析了 KVzip 如何识别重要的缓存信息,并展示如何使用预填充期间已计算的信息来近似其重建分数。这些发现激发了 EchoPress 的发展,这是一种无需训练的方法,可以使用标准预填充中的查询和键来近似重建注意力。对于每个请求,它仅重建第一个块以校准剩余上下文的重要性分数。使用 Qwen3-8B 和 Llama-3.1-8B-Instruct 在 LongBench 和 RULER 上进行的实验表明,EchoPress 在逐出率从 50% 到 90% 的任务准确度上与 KVzip 相匹配,同时将压缩开销减少了 1.7-19.6 倍,将总预填充时间减少了 2.9 倍。代码可在 https://github.com/ljwljwljwljw/kvpress/tree/echo-press. 获取