论文

MEME:多实体和进化记忆评估

MEME: Multi-entity & Evolving Memory Evaluation

模型评测上下文与知识记忆基准与评测资源

摘要

基于 LLM 的代理越来越多地在持久环境中运行,它们必须在许多会话中存储、更新和推理信息。虽然之前的基准仅评估单实体更新,但 MEME 定义了跨越多实体和演化轴定义的整个空间的六项任务,其中包括之前工作未评分的三项任务:级联和缺席(依赖推理)以及删除(删除后状态)。通过在 100 个受控事件上评估跨越三种内存范式的六个内存系统,我们发现尽管有足够的静态检索性能,但所有系统在默认配置下(级联:3%,缺席:平均准确度为 1%)下都在依赖推理上崩溃。及时优化、更深层次的检索、减少填充噪音以及最强的 LLM 都无法弥补这一差距。只有基于文件的代理与 Claude Opus 4.7 配合使用,因为其内部 LLM 部分缩小了差距,但成本约为基准成本的 70 倍,这表明目前的关闭取决于在规模上不切实际的配置。代码和数据可在项目页面上找到:https://seokwonjung-jay.github.io/meme-eval/。