论文

EngramaBench:通过结构化图检索评估长期会话记忆

EngramaBench: Evaluating Long-Term Conversational Memory with Structured Graph Retrieval

模型评测基准与评测资源

摘要

大语言模型 助理越来越被期望能够保留和推理在许多会话中积累的信息。我们推出了 EngramaBench,这是一个长期会话记忆基准,围绕五个角色、一百个多会话会话和一百五十个查询构建,涵盖事实回忆、跨空间整合、时间推理、对抗性弃权和紧急综合。我们针对 GPT-4o 全上下文提示和 Mem0(一种开源向量检索记忆系统)来评估 Engrama(一种图结构记忆系统)。这三者都使用相同的应答模型(GPT-4o),隔离内存架构的影响。 GPT-4o 全上下文取得了最高的综合得分(0.6186),而 Engrama 在全球范围内得分为 0.5367,但它是唯一一个在跨空间推理上得分高于全上下文提示的系统(0.6532 vs. 0.6291,n=30)。 Mem0 最便宜,但要弱得多 (0.4809)。消融揭示了驱动 Engrama 跨空间优势的组件与全局综合得分之间的权衡,暴露了结构化内存专业化和聚合优化之间的系统级紧张关系。