论文

当证据发生变化:评估语言模型智能体的记忆修复与重读

When Evidence Changes: Evaluating Memory Repair and Re-reading in Language-Model Agents

上下文与知识记忆Agent记忆

摘要

支持智能体派生事实的文档被撤销或替换后,应该修复记忆,还是重新读取当前证据?我们以公开 ICU 病历中的用药列表和问题列表任务建立证据修订评估。在撤销、替换和对照事件下,使用两个 7B 模型比较完整重读、按来源过滤后重读、缓存、重建以及图局部修复。实验完整提供记忆,不经过检索;成本包含摄取、修订及每次使用。在短病历上,局部修复所需修订 token 比重建少 5—10 倍,但在留出条件下,所有记忆流程的成本都至少是完整重读的两倍。在一项小规模、预先规定的开发集扫描中,我们加入不适用于任务的文档,将记录延长到约 10,000 个 token;在此长度下,记忆的平均累计成本在使用 2—14 次后低于完整重读,部分原因是提取被截断,而按来源过滤后重读仍然最便宜。在证据替换研究中,四项主要验证性检验均未达到统计显著性。这些结果说明,评估证据修订后智能体记忆的成本,应覆盖整个流程,并以按来源过滤后重读作为对照。