论文

M$^3$Eval:通过基于认知的视频任务进行多模式记忆评估

M$^3$Eval: Multi-Modal Memory Evaluation through Cognitively-Grounded Video Tasks

模型评测基准与评测资源

摘要

随着多模态模型向长视频理解方向发展,记忆成为一项关键能力。尽管在开发视频数据集和基准方面做出了大量努力,但现有的工作主要集中在感知和推理上,而没有系统地评估记忆:模型保留了哪些内容,信息保存的忠实程度以及记忆在干扰下保持的稳健程度。为了解决这一差距,我们引入了 M$^3$Eval,这是第一个用于探测多模态模型中不同内存维度的综合评估框架和基准。我们的设计以认知心理学为基础,精心构建任务,隔离记忆的关键方面。利用 M$^3$Eval,我们对代表性多模态模型进行了广泛的实验,揭示了一致的弱点和独特的行为。我们发现,模型在处理并行视频流时很难保持解开的表示,表现出与人类记忆中观察到的干扰模式有很大不同,在空间域中比在时间域中更可靠地处理记忆源,并且表现出有限的符号记忆。总的来说,我们的基准为未来的研究提供了宝贵的资源,而我们的研究结果强调了记忆作为一种基本但尚未充分开发的能力,并为在多模式模型中设计更有效的记忆机制提供了见解。我们的代码和数据集可在 https://pku-value-lab.github.io/m3eval-homepage 获取。