论文
淘汰破坏了什么:对代理内存中遗忘的恢复反事实审计
What Eviction Destroys: A Restore-Counterfactual Audit of Forgetting in Agent Memory
摘要
当代理内存系统的历史记录超过固定的 词元预算 时,必须丢弃存储的信息。现有的预算准确性边界量化了由此产生的准确性损失,但没有区分因淘汰和可恢复的检索失败而导致的不可逆转的损失。我们引入了恢复反事实,这是一种针对每个问题的配对干预,可以在阅读时上下文中恢复问题的标准答案所需证据并重新运行同一读者。将正确性的变化与淘汰后证据是否保留相结合,将每个预言机可回答的错误分类为可恢复、不可逆转或残留;在剩下的情况下,恢复后答案仍然不正确。我们在三种预算和两种检索机制下评估 LongMemEval-S 上的 FIFO、随机、冗余感知和 LLM 重要性淘汰,使用 GPT-4o-mini 作为主要读取器和判断器,使用 GPT-5.4-mini 作为鲁棒性读取器。在 80k-词元预算 的 top-k 检索下,对于 FIFO、随机和冗余感知逐出,通过恢复纠正的错误之间的不可逆份额为 0.67-0.73,而对于 LLM 重要性为 0.60。在 8k 词元的情况下,所有四种策略都达到 1.00。可恢复的错误发生在 80k 词元的 top-k 检索下,但在构造强制注入标准证据下不存在,因此除非报告检索机制,否则预算准确性结果不能直接比较。探索性匹配准确度分析发现,准确度匹配的政策对之间的不可逆转率没有差异,分辨率为 1.2-6 个百分点。相同的分析检测到故意破坏性的控制。据我们所知,这是在标准对话基准上对外部代理内存存储逐出的第一个按项目、按问题的恢复反事实审核。