论文
RestoreKV:在与查询无关的积极 KV 缓存驱逐下恢复全缓存行为
RestoreKV: Recovering Full-Cache Behavior Under Aggressive Query-Agnostic KV Cache Eviction
摘要
与查询无关的 KV 缓存驱逐会压缩上下文一次,然后将生成的缓存重新用于任意未来的查询,但在预算紧张的情况下性能可能会崩溃。现有方法主要改进保留哪些原始KV对。我们引入了 RestoreKV,它在相同的总 KV 预算下通过学习恢复来补充这种基于选择的公式。我们的主要见解是,尽管通过驱逐丢失的信息是特定于上下文的,但生成其紧凑补充的机制可以跨上下文共享。上下文预填充后,一些恢复词元会在单个 LoRA 适应通道中处理完整的 KV 缓存,从而生成紧凑的、上下文调节的恢复缓存。基本重要性评分器和逐出规则保持不变,并且对于所有后续查询和解码禁用适配器。 RestoreKV 通过来自冻结全缓存模型的参数高效自 蒸馏 进行训练,仅优化 $0.4\%$ 参数,并且不需要特定于任务的调整。在四个主干网和四个长上下文基准测试中,RestoreKV 大大减少了压缩引起的性能下降。在 Qwen3-4B 上,它改进了五种基本驱逐方法中 60 个配对、预算匹配设置中的 59 个;在 5\%$ 预算下,RULER-4K 上的 KVzip 从 38.2提高到 73.2。应用于 KVzip+ 时,RestoreKV 在 KVPress 基准测试中以 $16\times$ 压缩达到 $86.4$ RULER 精度,同时在 32K 上下文评估中增加了不到 $0.5\%$ 的一次性缓存构建开销。我们的项目页面位于 https://paper.pnu-cvsp.com/RestoreKV/