论文
UTILMEM:长期会话记忆中证据利用的基准测试
UTILMEM: Benchmarking Evidence Utilization in Long-Term Conversational Memory
摘要
长期记忆对于对话代理来说越来越重要,但现有的基准主要通过逐点事实回忆来衡量记忆:系统是否可以从先前的交互中恢复孤立的事实或事件级细节。然而,现实世界的记忆使用通常需要更高的能力:将扩展的交互历史中的分布式、隐式和嘈杂的证据集成为连贯的、面向任务的输出。我们称这种能力为内存利用率。在这里,我们介绍了 UtilMem,这是一个诊断基准,包含五个领域的 1,717 个实例,旨在评估记忆利用的四个尚未充分探索的方面:对密集历史进行推理,识别隐式相关记忆,将分布式证据合成为摘要、分析或计划,以及抵抗语义相似干扰项的干扰。通过评估各种基于检索和内存增强的系统,我们发现传统事实内存基准的强大性能并不能可靠地转化为有效的内存利用率。此外,仅靠检索是不够的:即使成功恢复了相关证据,系统也经常无法跨会话整合信息或区分有用的证据和看似合理的干扰因素。这些发现揭示了访问存储信息和有效使用信息之间存在巨大差距,并表明长期会话记忆的进步将需要明确支持证据集成和检索干扰稳健性的架构。代码可在 https://github.com/peijunallin/UtilMem 获取。