论文

连续性而非重要性:文档编辑后过期KV缓存的预算内修复

Contiguity, Not Importance: Budgeted Repair of Stale KV Caches After Document Edits

模型推理KV Cache

摘要

KV缓存复用可降低RAG和智能体系统推理成本,但检索知识、工作记忆或用户状态编辑后,上下文缓存可能过期。因果自注意力下,局部编辑也会影响后续KV状态。完整重新预填充可可靠恢复一致性但成本高,仅刷新编辑片段又可能留下过期依赖。我们把原地修复表述为预算约束重算,在具有匹配直接与派生编辑的事实RAG基准上比较无需训练的位置选择策略。在三个模型家族上,所有策略都修复直接案例,派生案例却明显区分方法。在主要预算下,连续的编辑局部窗口恢复至少0.94的编辑后答案间隔,显著优于基于注意力、KV偏差和结构的选择器。机制分析显示,在干净状态移植下有效的位置集合,实际重算时可能失败,因为分散位置继承周边过期状态。局部编辑优势还依赖相邻性,答案文本移至下游较远处后基本消失。由于答案相关编辑几乎总会损坏模型行为、失败严重程度难预测,且修复比完整重新预填充快13—21倍,结果支持在依赖文本仍邻近编辑处时无条件执行局部修复。