论文
RelaxKV:通过具有稀疏上下文注意的查询引导重新计算,以实现高效的 KV 缓存重用
RelaxKV: Recomputation Guided by the Query with Sparse Context Attention for Efficient KV Cache Reuse
摘要
跨请求 KV 缓存降低了检索增强生成 (RAG) 的预填充成本,但传统的前缀缓存严重限制了跨请求的缓存重用。位置无关缓存 (PIC) 通过重用独立块消除了这一限制,但它们的 KV 状态错过了跨块交互。现有方法有选择地重新计算词元状态以恢复这些丢失的交互,但主要分配重新计算预算来选择要重新计算的状态,同时将重新计算上下文固定为完整的因果前缀。我们引入了 RelaxKV,它将选择性缓存修复制定为修复目标和重新计算上下文的联合分配问题。在用户查询的指导下,RelaxKV 识别特定于层的修复目标,并将其重新计算限制在与查询相关的上下文中,从而减少注意力计算。在四个解码器模型中,15% 锚定率的 RelaxKV 在所有模型上都比 ProphetKV 提高了 LongBench 的总体性能。在 Qwen3-14B 上,RelaxKV 在 5%-30% 锚定比扫描范围内提供了比 ProphetKV 更强的质量-TTFT 权衡,并在 16K 和 32K 上下文长度下在 RULER-MV 和 LV-Eval 上实现了最佳选择性结果。受控消融进一步证明了重新计算上下文选择的重要性。