论文
过期、归属错误与延迟:个人记忆在生成前的故障
Stale, Misattributed, or Late: Where Personal Memory Fails Before Generation
摘要
语言主体的个人记忆通常通过最终答案是否正确来判断。该分数隐藏了生成之前出现的错误:内存块可能包含过时的值、有关错误人员的事实,或者在服务截止日期之前没有有用的事实。我们直接测量这些故障。使用个人事实记忆(PFM)作为参考层,我们发现时间有效性主要是我们环境中记忆构建的一个属性。在受控修订基准上,仅提供每个正确键入的插槽的活动值可以消除观察到的陈旧暴露;如果没有更新解决方案,70.3% 的提示会公开被取代的值。一旦检索器共享相同的活跃商店和参与者信息,参与者感知的 BM25 就相当于预先指定的 0.02 裕度内的参考排名器。更困难的问题是将修订分配到正确的位置。错过的合并会使过时的值保持活动状态,而错误的合并则默默地删除当前值;四个 LLM 密钥分配器比规则提取器实现了更高的密钥召回率,但产生了较低的干净检索率,并且 LongMemEval 上的开放域合并召回率从未超过 0.062。错误归因在有效性过滤中仍然存在:实体后验减少了受控数据上的同名暴露,但无法区分 LoCoMo 中同名的说话者。两个冻结的语言模型在生成的文本中重现提示错误。检索延迟因排序器而异,但提示预填充主导了我们硬件上的回合级延迟。这些结果支持在生成之前评估Agent记忆,分离存储状态有效性、身份解析、弃权和服务延迟。