论文
MemConflict:评估记忆冲突下的长期记忆系统
MemConflict: Evaluating Long-Term Memory Systems Under Memory Conflicts
摘要
长期记忆系统使基于 大语言模型 (LLM) 的会话代理能够在多会话交互中保留、检索和应用用户特定信息。然而,现有的评估主要评估结果水平的表现或时间更新,对系统如何在相互冲突的替代方案下检索和排序时间有效、事实正确和上下文适用的记忆证据提供有限的了解。为了解决这一差距,我们提出了 MemConflict,这是一个诊断框架,它将内存有效性视为查询条件的适用性问题。 MemConflict 将时间有效性、事实正确性和上下文适用性方面的动态、静态和条件冲突形式化。它从结构化用户配置文件中模拟受控的长期历史,引入跨会话冲突,并注入语义相似的干扰因素以在候选内存之间产生竞争。由此产生的多会话对话基准支持最终答案的黑盒评估和支持记忆检索和排名的白盒分析。对六种代表性长期记忆系统的实验表明,不同冲突类型的强度参差不齐,答案的正确性往往与记忆检索和排序不同。敏感性分析表明,较长的历史记录、干扰因素、隐式查询和较大的冲突距离会降低性能。诊断显示由于缺少支持记忆和无效使用检索到的记忆而导致的失败。总的来说,MemConflict 通过检索感知、冲突感知的可靠性评估推进有原则的长期记忆治理。