论文

AgentKVShift:面向智能体记忆系统的高效KV缓存复用

AgentKVShift: Efficient KV Cache Reuse for Agentic Memory Systems

模型推理上下文与知识KV Cache记忆Agent记忆

摘要

记忆增强的LLM智能体通过智能体记忆系统在数百次交互间维持上下文,这些系统用LLM生成的摘要、关键词和标签等元数据主动整理检索到的内容。从推理成本角度看,每次检索都会触发把这些结构化记忆单元完整重新编码为键值(KV)状态,这主导了prefill延迟。现有的免训练KV复用方法通过选择性重算少量token来缓解这一问题,但它们是为RAG式原始段落设计的,在结构化智能体记忆上性能会退化。我们提出AgentKVShift,一种免训练、由探针引导、按单个检索记忆单元操作的KV残差校正方法。我们展示的一个关键洞察是:每个记忆单元的KV复用残差可分解为共享的记忆级偏移量加上较小的逐token波动。用小规模探针集估计该偏移量,使我们能通过一次加权校正来修正每个被复用的token。与以往只决定重算哪些token而让缓存其余部分保持陈旧的方法不同,AgentKVShift还会校正其未重算的token,使刷新预算在整个chunk上都转化为有用信号。在覆盖3B到32B参数的四个开源LLM和两个长程智能体记忆基准(长期对话与智能体应用)上,AgentKVShift仅刷新10-30%的缓存即达到接近全量重算的性能,并在相同重算比例下优于基线。它只需最多低5倍的重算量即可达到这种接近全量的性能,而以往的复用方法要在45-55%的刷新比例下才能达到。在此区间内,AgentKVShift在单张A100上相较不使用KV复用取得2-3.5倍的prefill加速。AgentKVShift还可与KV缓存量化正交组合,在激进的2比特和4比特设置下保持超过以往复用方法2倍的F1。

AgentKVShift:面向智能体记忆系统的高效KV缓存复用:论文配图
图 1:AgentKVShift:通过残差估计重用 KV。使用探测标记估计平均残差 Δ​Kavg\Delta K_{\text{avg}} 和 Δ​Vavg\Delta V_{\text{avg}} 并将其应用于非探测标记以产生 KnewK_{\text{new}} 和 VnewV_{\text{new}},近似完全重新计算。