论文
AgentMemBench:系统评估对话智能体长期记忆管理策略
AgentMemBench: A Systematic Benchmark for Evaluating Long-Term Memory Management Strategies in Conversational AI Agents
摘要
长期记忆是对话智能体的关键瓶颈,有限上下文难以支持跨数千回合的连贯召回。AgentMemBench在相同条件下评估上下文窗口ICW、外部键值存储EKV、图情景记忆GEM、压缩摘要CBS及网络增强记忆WAM。三个公开数据集覆盖LoCoMo多会话对话、MultiDoc2Dial文档依据问答和MSC角色多会话聊天,共491个标注问题回合,使用Recall@k、MRR、nDCG@k、答案F1、LLM忠实性评判、记忆占用及延迟。生成与评判均使用4比特Qwen2.5-7B-Instruct和贪婪解码。EKV在各质量轴上领先,宏Recall@5为0.792、MRR为0.677、F1为0.156、忠实性为0.354。LoCoMo的参考回合位于许多会话之前时,其他四种策略的Recall@5不超过0.005,EKV为0.573,体现该设置下稠密检索的长程优势。CBS总体检索表现次于EKV,为0.556;由于网络结果无语料内来源,WAM的语料内召回按构造与ICW相同。EKV的召回优势伴随约5100词元占用,相比ICW/WAM约300词元,存在准确性与效率权衡。研究还在相同评测框架中比较MemGPT/Letta与HippoRAG,并发布代码、环境与结果。