论文

EvoMemBench:比较记忆更新、经验复用与长上下文方案的实际效果

EvoMemBench: Benchmarking Agent Memory from a Self-Evolving Perspective

智能体系统上下文与知识上下文工程记忆Agent任务评测Agent记忆

摘要

近期大语言模型Agent基准主要评测推理、规划与执行,但记忆同样重要,它使Agent能够持续保存、更新和检索信息。由于缺少系统评估记忆机制的方法,这种能力仍未得到充分评测。本文从自我演进的角度研究Agent记忆,提出统一基准EvoMemBench,按两个维度组织任务:记忆范围,即单次任务内或跨任务;记忆内容,即知识导向或执行导向。本文在标准化协议下比较15种代表性记忆方法与较强的长上下文基线。结果表明,当前记忆系统距离通用方案仍有差距:长上下文基线依然很有竞争力;当前上下文不足或任务较难时,记忆更能发挥作用;没有一种记忆形式能在所有设置中持续占优。基于检索的方法在知识密集任务上表现较强;当保存的经验与任务结构匹配时,程序性记忆与长期记忆更适合执行型任务。本文希望该基准推动更有效的Agent记忆研究,代码已公开。

EvoMemBench:比较记忆更新、经验复用与长上下文方案的实际效果 配图
图1:EvoMemBench按记忆范围与内容组织评测。