论文

MemEye:以视觉为中心的多模式代理记忆评估框架

MemEye: A Visual-Centric Evaluation Framework for Multimodal Agent Memory

模型评测上下文与知识记忆基准与评测资源Agent记忆

摘要

长期智能体记忆越来越多模式化,但现有的评估很少测试智能体是否保留了后续推理所需的视觉证据。在之前的工作中,许多基于视觉的问题可以仅使用标题或文本痕迹来回答,从而可以在不保留细粒度视觉证据的情况下推断出答案。与此同时,需要对改变视觉状态进行推理的更困难的情况基本上不存在。因此,我们引入了MemEye,一个从两个维度评估记忆能力的框架:一个衡量决定性视觉证据的粒度(从场景级到像素级证据),另一个衡量如何使用检索到的证据(从单一证据到进化合成)。在此框架下,我们构建了涵盖 8 个生活场景任务的新基准,并使用消融驱动的验证门来评估可回答性、捷径阻力、视觉必要性和推理结构。通过评估 4 个 VLM 主干的 13 种记忆方法,我们发现当前的架构仍然难以保留细粒度的视觉细节并推理状态随时间的变化。我们的研究结果表明,长期多模态记忆取决于证据路由、时间跟踪和细节提取。