论文

EgoMonth:长期时空记忆的月级自我中心视频基准

EgoMonth: A Month-Level Egocentric Video Benchmark for Long-Term Spatiotemporal Memory

模型评测基准与评测资源

摘要

多模态 大语言模型 (MLLM) 的最新进展导致视频理解方面取得了实质性进展,同时长视频基准的数量也不断增加。然而,现有的基准主要依赖于缺乏剪辑间时空连续性的网络视频,因此很难评估模型是否可以在数天或数周的现实世界体验中保持一致的记忆。我们推出了 EgoMonth,这是第一个月级自我中心视频理解基准。 EgoMonth 包含 20 名参与者在 20 至 120 天内录制的超过 300 小时的第一人称日常生活录音,并配有 1,443 个人工制作的多项选择题答案对。我们设计了一个基于认知的 14 项任务评估框架,该框架分为三个层次认知级别:图式整合、情景索引和级联推理。对最先进的开源和闭源 MLLM 的评估表明,即使是性能最好的模型 Gemini 2.5 Pro,其宏观平均准确率也仅为 71.8%,比修正后的人类基线 94.2% 低 22.4 个百分点。一些模型在路线推理、跨视图空间推理和方向判断等任务上的表现接近或低于 25% 的机会水平,而即使是最强大的闭源模型仍然大大低于人类表现。这些结果表明,当前 MLLM 的功能是有损总结器,而不是忠实的记忆器,这凸显了对具有真正长期时空记忆的架构的需求。