论文

WorldMemArena:通过动作与世界交互评估多模式代理记忆

WorldMemArena: Evaluating Multimodal Agent Memory Through Action-World Interaction

模型评测基准与评测资源

摘要

多模态 大语言模型 越来越多地被部署为长视野代理,其中记忆的作用不仅仅是回忆:它必须跟踪不断变化的世界,修改已经过时的内容,并在决策时提供正确的证据。现有的基准衡量静态对话的召回率,将记忆分解为单个任务结束的准确性,并将视觉观察减少到描述文本,使我们无法定位写作、维护、检索或使用的失败。创造自己记忆的代理工具的兴起加剧了这一差距,因为我们没有原则性的方法来比较手工设计的管道和自我管理的替代方案。为了弥补这些差距,我们将多模式代理记忆制定为具有可观察的四阶段生命周期的动作世界交互循环,并在 WorldMemArena 中实例化它:400 个多会话多模式任务,涵盖终身进化(不断发展的个人和任务状态)和代理执行(来自真实观察、操作和反馈的记忆),并用黄金记忆点、更新、干扰因素和用于阶段级诊断的证据链进行注释。这使得首次能够对长上下文、手动设计(RAG 和外部存储系统)以及基于Harness的存储代理进行头对头比较。结果表明:(1)更好的内存写入和存储并不能保证更好的性能; (2)多模态记忆仍然难以充分利用视觉证据; (3) 系统在跨领域不稳定并且在现实的代理轨迹上退化; (4)Harness存储器更灵活,但成本仍然较高且可靠性较低。