论文
MemoryArena:用相互依赖的多会话任务评测Agent记忆
MemoryArena: Benchmarking Agent Memory in Interdependent Multi-Session Agentic Tasks
摘要
现有带记忆Agent的评测通常将记忆与行动分开考察。一类基准通过回忆过去对话或文本评测记忆,却无法反映记忆如何指导未来决策;另一类关注单会话任务中的行动,不要求长期记忆。实际使用中,两者紧密相连:Agent在与环境交互时形成记忆,随后依靠这些记忆解决未来任务。为覆盖这一情境,本文提出MemoryArena,在多会话的记忆、Agent与环境循环中统一评测Agent记忆。基准由人工构建的Agent任务组成,子任务之间具有明确依赖;Agent必须从早先的行动与反馈中提炼经验形成记忆,再用这些记忆指导后续行动,完成整体任务。MemoryArena覆盖网页导航、受偏好约束的规划、渐进式信息搜索和顺序形式推理。结果显示,在LoCoMo等长上下文记忆基准上已接近饱和的Agent,在这些Agent任务中表现不佳,揭示了现有记忆评测的缺口。
