论文
AgentKVShift:面向智能体记忆系统的高效KV缓存复用
AgentKVShift: Efficient KV Cache Reuse for Agentic Memory Systems
摘要
记忆增强的LLM智能体通过智能体记忆系统在数百次交互间维持上下文,这些系统用LLM生成的摘要、关键词和标签等元数据主动整理检索到的内容。从推理成本角度看,每次检索都会触发把这些结构化记忆单元完整重新编码为键值(KV)状态,这主导了prefill延迟。现有的免训练KV复用方法通过选择性重算少量token来缓解这一问题,但它们是为RAG式原始段落设计的,在结构化智能体记忆上性能会退化。我们提出AgentKVShift,一种免训练、由探针引导、按单个检索记忆单元操作的KV残差校正方法。我们展示的一个关键洞察是:每个记忆单元的KV复用残差可分解为共享的记忆级偏移量加上较小的逐token波动。用小规模探针集估计该偏移量,使我们能通过一次加权校正来修正每个被复用的token。与以往只决定重算哪些token而让缓存其余部分保持陈旧的方法不同,AgentKVShift还会校正其未重算的token,使刷新预算在整个chunk上都转化为有用信号。在覆盖3B到32B参数的四个开源LLM和两个长程智能体记忆基准(长期对话与智能体应用)上,AgentKVShift仅刷新10-30%的缓存即达到接近全量重算的性能,并在相同重算比例下优于基线。它只需最多低5倍的重算量即可达到这种接近全量的性能,而以往的复用方法要在45-55%的刷新比例下才能达到。在此区间内,AgentKVShift在单张A100上相较不使用KV复用取得2-3.5倍的prefill加速。AgentKVShift还可与KV缓存量化正交组合,在激进的2比特和4比特设置下保持超过以往复用方法2倍的F1。
