论文

Agent记忆的认知:测量和管理,长期 LLM Agent的合并决策

The Epistemics of Agent Memory: Measuring, and Governing, the Consolidation Decision in Long-Horizon LLM Agents

上下文与知识记忆Agent记忆

摘要

长远的LLMAgent必须将积累的经验转化为持久的记忆,决定保留什么、压缩什么、抽象成可重用的技能和规则,或者忘记什么。我们报告了一个关于这个整合问题的四阶段研究计划,其核心发现是测量内容的转变:从智能体记住了多少,到其整合决策是否良好,再到这些决策是否可信。第 1 阶段通过下游实用程序从Agent跟踪中学习情景边界;诚实的险些发生(预言机相关性 0.691 vs 0.70 bar),其持久输出是三门防泄漏协议。第 2 阶段学习何时提升体验以及在词元预算下提升到哪个抽象级别,通过 7 倍压缩实现了经过验证的 +22.7% 任务成功率改进,但暴露了退化遗忘故障和分布转移故障模式,我们将其称为 lambda 流行耦合。第 3 阶段引入了 ConsolidationBench,这是一种基于构建的预言机基准,可根据三个不依赖循环论证的维度上的已知最优值对整合决策进行评分;生产检索系统保留信息,但在跨级传输上得分为零。第四阶段引入了受控整合:决策包含抗投毒、可逆性和可审计性保证以及质量门。治理在统计上与质量得分不同($r^2 = 0.43$;部分$r = 0.27$;相同质量的策略在治理方面差异三倍),因此贡献独立于指标的外部有效性而存在。在这个问题上,我们报告了一个已解决的负面结果:在分级重用重新设计消除了结构上限后,对 2,532 个真实答案单元进行的两项基准研究发现,质量得分并不能预测真实的转移准确性(合并 Spearman $\rho = -0.24$,n = 12,CI 跨越零)。对抗性的自我批评通过了最终的索赔,最终保留的主张中没有过度表述。