论文

保持简单:用于超长视频理解的多关键情景记忆检索

Keep It Simple: Multi-Key Episodic Memory Retrieval for Ultra-Long Video Understanding

上下文与知识检索增强

摘要

当视频从几小时延长到几天时,对于当前的多模态 大语言模型 (MLLM) 来说,直接端到端处理它们变得不切实际。这种超长的设置需要一个两阶段的范例:查询不可知的内存构建,然后是基于检索的推理。之前的工作投资于复杂的内存构建,以预先建模视频中的高级关系,尽管在构建时不知道下游查询。相反,我们在内存构建期间优先考虑高召回率的可检索性,并将特定于查询的高级关系组合推迟到推理时间。为此,我们提出了 MERIT(具有推理时间时间扩展的多键情景检索),这是一种简单而有效的超长视频理解代理框架。首先,我们制定了一种情景多密钥表示,可以通过简单的密钥匹配机制精确检索细粒度记忆。其次,我们引入了邻居过滤机制来捕获更广泛的语义上下文,而无需全局内存构建的大量计算开销。这是通过在推理时仅扩展围绕检索片段的时间范围来实现的。通过利用简单的键匹配和这种按需时间扩展,MERIT 在三个长视频基准测试中实现了最先进的性能:EgoLifeQA、LVBench 和 Video-MME(长)。