论文

MemDecay:区域感知 KV 缓存驱逐,实现高效 LLM 代理推理

MemDecay: Region-Aware KV Cache Eviction for Efficient LLM Agent Inference

模型推理KV Cache

摘要

大语言模型(LLM)代理积累异构上下文,包括系统指令、计划、用户轮流、检索的文档、工具输出和中间推理,其键值(KV)缓存可能成为主要的内存瓶颈。现有的驱逐策略通常对每个词元应用相同的基于注意力或新近度的规则,忽略代理协调器已经可用的语义结构。我们引入 MemDecay,一种 无需训练、区域感知的 KV 缓存驱逐策略。 MemDecay 分配词元区域特定的基本优先级和衰减率,当词元受到关注时刷新保留分数,并在固定缓存预算下驱逐得分最低的页面,同时允许固定关键区域。我们还提供了一个根据测量的注意力寿命来校准衰减率的程序。我们使用 Qwen2.5-1.5B 和 3B 在大约 450 和 1,700 个词元上下文中评估 MemDecay。在所有设置中,注意力寿命在不同区域之间存在一个数量级的差异:系统词元半衰期范围为 148 到 189 个解码步骤,而暂存词元的半衰期为 14 到 16 个。固定在每种设置中都以全缓存精度保留系统区域事实,而没有基线保留超过 24 个中的 13 个。随着上下文的增长,区域感知保留仍然有效,而基于新近度的保留会崩溃。然而,累积注意力保留在未固定内容上表现更好,并且消融将注意力分数标准化视为当前公式的主要限制。这些结果将语义提示结构建立为 KV 缓存管理的稳健信号,同时阐明了如何将其与基于注意力的重要性相结合。