论文
EvalMem:长期记忆系统的操作级诊断框架
EvalMem: An Operation-Level Diagnostic Framework for Long-Term Memory Systems
摘要
与基于大语言模型的助手的长期交互需要能够保存和更新用户状态、偏好和交互历史的存储系统。现有的评估报告端到端的 QA 准确性,无法确定错误是否来自编码、检索或生成。我们引入了 EvalMem,一个具有三个并行检查器的操作级诊断框架。对于每个查询,编码检查器检查目标事实是否已存储,检索检查器评估本机检索器是否返回可用的证据,生成检查器测试模型是否可以根据预言证据进行回答。它们的输出形成细粒度的多标签缺陷代码。为了改进商店级别的诊断,我们采用召回优先策略来调整代理 RAG,该策略使用查询和源证据进行搜索,将 LoCoMo 上现有证据的召回率从 70.2% 提高到 95.6%。在 LoCoMo、LongMemEval-S 和动态 DynaMem-Bench 上对七个内存系统进行的评估将检索确定为最常见的故障层;在默认的 LoCoMo 中,检索缺陷达到 22.1%,而编码为 7.7%,生成为 6.5%。在此诊断的指导下,MemWiki(一种根据每个系统的内存导出构建的搜索友好的辅助结构)在 LoCoMo 和 LongMemEval-S 上分别将平均准确度提高了 2.5 个百分点和 2.3 个百分点。