论文
MemoryLake on MemoryArena:Agent记忆后端的匹配对比研究
MemoryLake on MemoryArena: A Matched Study of Agent Memory Backends
摘要
大多数Agent记忆基准测试的是事后回忆能力,而MemoryArena评估的是记忆能否支持相互依赖的多会话任务完成。我们在MemoryArena全部五个领域上比较MemoryLake(一种结构化多轨记忆后端)与Mem0、text-embedding-3-small向量RAG以及长上下文对照。这些系统共享相同的Agent框架、所请求的gpt-5-mini模型别名、任务样本与评分代码;记忆集成是唯一有意改变的组件。由于每个后端都捆绑了写入、检索、整合、预算与提示组装等选择,本研究是系统级匹配对比,而非仅表征层面的消融或成本匹配实验。在共享评估集上,MemoryLake在数学(9/40)、物理(12/20)和渐进检索(4/20)中具有最高的观测成功率(SR)。所有系统在旅行规划上的成功率均为零,网页购物仅有一次bundle级成功(长上下文,1/150);MemoryLake在旅行软过程得分和购物步骤匹配上均排名第三。按照MemoryArena的套件级惯例,对五个成功率做事后等权平均,MemoryLake为20.5%,最佳对照为13.6%。这些是点估计:样本量有限,置信区间重叠,且我们未报告配对显著性检验。另一项仅针对MemoryLake、覆盖全部221个渐进查询的单独运行,得到按失败计数的成功率26.7%(59/221),且不构成基线比较。这些结果支持记忆后端效果因工作负载而异的观点,以及四个受评系统在共享评估集上的观测领先;它们并不能确立基准范围内的最先进水平,也不能确立表征结构的因果优势。