论文
LLM Agent中用于高效内存压缩的持久上下文图
Persistent Context Graphs for Efficient Memory Compaction in LLM Agents
摘要
随着大语言模型能力的进步,Agent正在更长的时间内处理日益复杂的任务。它们不断增长的交互历史使得内存压缩对于保持在上下文窗口内和降低预填充成本至关重要。现有方法总结历史或压缩其 KV 缓存,通常添加模型计算以保留未来请求的信息。新的用户请求可以更改重要的历史记录,但是如果 KV 缓存已过期,则使用模型重新评估该历史记录需要重新编码。过去的注意力提供了历史重要性和消息之间的依赖性的信号,而必须使用新的用户请求来评估与当前任务的相关性。我们引入了 ReCAP,这是一种内存压缩方法,它将注意力导出的重要性分数和依赖链接存储在轻量级、持久的上下文图中。对于每个新请求,ReCAP 将存储的重要性与请求中的相关线索相结合,并遵循依赖关系链接来选择消息及其支持上下文,而无需额外的模型调用来进行选择。与 Codex 默认的基于摘要的压缩相比,ReCAP 在 Qwen3-Coder 和 gpt-oss 上将压缩和冷恢复的估计延迟减少了约 95%。它还以可比较的任务质量将 SWE-Together 上每次调用的历史上下文大致减半,并将 Lost-in-Conversation 的代码任务的准确性提高了 19.8 点和 41.2 点。