长期运行AI代理记忆中的压缩悬崖
The Compaction Cliff in Long-Running AI Agent Memory
摘要
在AI代理的上下文中,一条安全规则与一份情节日志争夺同一批token。当预算溢出时,两者以相同速率被摘要压缩;而只有规则需要精确措辞才能保持可执行。在20个生产级代理配置上,Claude Code在Sonnet 4.6上的/compact提示在一轮压缩后仅保留53%的安全规则,五轮后仅剩10%。我们将其命名为“压缩悬崖”(Compaction Cliff)。我们用知识分诊(Knowledge Triage)应对它:一个按类型对代理知识库的每一行进行分类、并让每种类型走各自保留策略的框架。三个确定性算子在三类上下文管理操作中实现该分诊:TypeCompact按类型保真度对条目就地重写;TypeDecompose将大到无法安全压缩的主题分区,并把范围内的安全规则复制到各分区;TypeRetrieve从外部存储取回条目,并把范围内规则固定排在相关性之前。在五个公开语料上,TypeCompact在每个压缩比率下保留的安全规则数量都是最强单次LLM压缩器的2–4倍,五轮后召回率96%。TypeDecompose将局部性违规降至0%,而均匀分区下为93%。TypeRetrieve达到100%的recall@50,最好的单次LLM检索器为73%。在三个下游行为基准上,我们在医疗合规上超过生产级Sonnet压缩器(保留性上配对McNemar p<10^-8,N=200),在零售任务通过率上超过全策略与分层基线(p<0.01,N=115),在航空领域超过分层压缩(p=0.024)。我们发布了AgentArtifactCorpus(来自54,628个公开GitHub仓库的396,934个代理配置)、分类器和参考实现。
