论文

主动上下文压缩:LLM代理中的自主记忆管理

Active Context Compression: Autonomous Memory Management in LLM Agents

上下文与知识上下文工程记忆Agent记忆

摘要

大语言模型(LLM)代理在长程软件工程任务中因“上下文膨胀”(Context Bloat)而举步维艰。随着交互历史增长,计算成本爆炸、延迟上升,且推理能力因被无关的过往错误干扰而退化。现有方案通常依赖代理无法控制的被动式外部摘要机制。本文提出Focus,一种受多头绒泡菌(黏菌)生物探索策略启发的以代理为中心的架构。Focus代理自主决定何时将关键学习成果整合进持久的“知识”(Knowledge)块,并主动撤回(修剪)原始交互历史。使用一个符合行业最佳实践的优化脚手架(持久bash + 字符串替换编辑器),我们在SWE-bench Lite的N=5个上下文密集实例上用Claude Haiku 4.5评估了Focus。在鼓励频繁压缩的强提示下,Focus实现了22.7%的token缩减(14.9M → 11.5M tokens),同时保持完全相同的准确率(两个代理均为3/5 = 60%)。Focus平均每个任务执行6.0次自主压缩,单个实例的token节省最高达57%。我们证明,有能力的模型在获得合适工具与提示时能够自主调节自身上下文,为不牺牲任务性能的成本感知agentic系统开辟了路径。

主动上下文压缩:LLM代理中的自主记忆管理
图2:上下文增长的概念性锯齿模式。Focus(蓝色)呈现周期性压缩(下降),而 Baseline(红色)单调增长。在激进提示(aggressive prompting)下,Focus 每 10-15 次工具调用压缩一次,在防止上下文膨胀的同时将学到的内容保留在持久的 Knowledge 块中。