论文

何时不写入内存:控制相关代理跟踪的错误提升

When Not to Write Memory: Governing False Promotion from Correlated Agent Traces

上下文与知识记忆Agent记忆

摘要

长寿的语言智能体越来越多地从自己的执行轨迹中写入可重用的记忆。关键的安全问题不仅在于智能体应该记住什么,还在于它们何时应该拒绝写入内存。跨主体的重复观察不一定是独立的证据:相同的主张可能是从共享来源复制的、由共享提示引起的、在新环境下过时的、或者仅在较小的范围内有效。我们将这种故障模式作为内存写入路径治理问题来研究。我们引入 GovMem 作为保守的诊断参考策略,它估计依赖性感知支持、检索反证据、分配范围并输出三个决策之一:促进、拒绝或需求审查。在受控综合压力测试中,GovMem 在默认设置下将错误提升从 0.597 减少到 0.040,同时在明确的审查负担下保留 0.960 的召回率。在项目内部的 120 个候选人类标记真实跟踪子集中,涵盖 79 个记录跟踪和项目报告,依赖性感知提升将源+范围的错误提升从 0.371 减少到总体 0.032,但保留的错误提升仍然为 0.111,并且该方法非常保守,审查负担为 0.692,直接召回率为 0.448。对 133 个高影响力的外部编码代理候选者的最终人工裁决更为严格:没有一个可以安全地自动升级,并且所有 11 个验证门阳性都被拒绝为样板文件、共享工具工件、文件转储或不可重用的调试跟踪。这些结果支持 GovMem 主要作为诊断治理设计点,而不是作为普遍验证或高效的自动内存编写器:代理内存写入路径应作为风险控制的证据治理系统进行评估,而在更强有力的主张之前,仍需要更广泛的外部覆盖范围和下游危害证据。