论文

超越帧选择:重新思考使用 MLLM 的长视频理解

Beyond Frame Selection: Rethinking Long-Video Understanding with MLLMs

上下文与知识上下文工程

摘要

多模态 大语言模型 (MLLM) 在视频理解方面取得了长足的进步,但长视频仍然很困难:视觉 词元预算 随着视频长度的增长而增长,因此时间稀疏的证据很容易丢失。现有的方法,无论是框架选择还是基于代理的探索,最终都依赖于一个单一的框架集,该框架集必须在广泛的时间覆盖范围与细粒度的、与问题相关的证据之间进行权衡:混合两者会削弱决定性的证据,而专注于其中一个会牺牲另一个。我们提出了 VideoRouter (VR),它将长视频理解重新思考为协调互补的证据视图,而不是选择单个帧子集。 VideoRouter 首先将每个视频组织成与问题无关的时间层次结构,将其划分为从粗到细的时间连贯片段。上层节点捕获广泛的故事情节背景和事件进展,而下层节点则保留细粒度的局部细节和证据时刻。这就产生了两种互补的观点:面向覆盖范围的推理的全局观点和面向细节的证据恢复的局部观点。我们进一步引入了一个验证引导路由器,它判断哪种观点更能被自己选择的证据支持,并决定最终答案。在六个主干网中,路由在所有设置中都优于两种视图,并且视图的选择显示为依赖于数据集,这证实没有单一证据粒度是普遍优选的。在 VideoMME 和 LongVideoBench 上,我们的方法在 LLaVA-Video-7B 主干下分别比最先进的帧选择方法高 2.5 点和 1.3 点。我们将发布代码。