论文
VideoRouter:查询自适应双路由,实现高效的长视频理解
VideoRouter: Query-Adaptive Dual Routing for Efficient Long-Video Understanding
摘要
视频大型多模态模型日益面临可扩展性瓶颈:长视频会产生过长的视觉标记序列,这会急剧增加推理过程中的内存和延迟。虽然现有的压缩方法在特定设置中是有效的,但大多数方法要么查询感知能力较弱,要么跨帧应用固定的压缩策略,当视觉证据随时间分布不均匀时,结果证明不是最佳的。为了解决这个问题,我们提出了 VideoRouter,这是一个基于 InternVL 构建的查询自适应双路由器框架,用于预算证据分配。语义路由器预测主导分配策略,在广泛的时间覆盖和自适应高分辨率保留之间进行选择,而图像路由器使用早期的 LLM 层对帧相关性进行评分。这可以对不太相关的帧进行积极压缩,同时保留关键证据帧的细节。为了训练这两个路由器,我们构建了用于分配策略监督的 Video-QTR-10K 和用于帧相关性监督的 Video-FLR-200K。 VideoMME、MLVU 和 LongVideoBench 上的实验表明,VideoRouter 在同等或更低的预算下持续优于 InternVL 基线,实现了高达 67.9% 的词元减少。