论文
VisualRouter:用于长视频理解的基于查询的视觉采样
VisualRouter: Query-Grounded Visual Sampling for Long Video Understanding
摘要
大型视觉语言模型(LVLM)在视频理解方面取得了重大进展,但由于大量的视觉标记和有限的上下文窗口,理解长视频仍然具有挑战性。视觉采样通过选择信息丰富的帧子集提供了一种实用的解决方案。然而,现有方法通常要么依赖于相关性感知采样,导致冗余帧选择和时间覆盖不足,要么采用固定采样策略,而不管查询类型如何。在本文中,我们提出了 VisualRouter,这是一种用于基于查询的视觉采样的 无需训练 和即插即用框架。 VisualRouter 首先将每个查询分类为全局或局部,然后应用相应的采样策略。对于全局查询,它采用相关性覆盖混合策略,在保留时间覆盖的同时保留与查询相关的视觉证据。对于本地查询,它采用事件感知帧选择策略,执行事件分区、段级帧分配和事件内帧选择,以有限数量的输入帧共同平衡相关性、覆盖范围和多样性。实验表明,VisualRouter 在均匀采样的基础上持续改进了多个 LVLM,在使用 Qwen2.5-VL-7B 的 Video-MME、LongVideoBench 和 MLVU 上实现了 5.2%、7.7% 和 11.6% 的增益,并且在相同设置下优于现有的 无需训练 视觉采样方法。