论文

重新思考长视频效率:帧、像素和前端延迟的联合分配视角

Rethinking Long-Video Efficiency: A Joint Allocation Perspective on Frames, Pixels, and Front-End Latency

模型推理推理加速

摘要

使用视觉语言模型(VLM)进行高效的长视频理解通常被定义为以固定的原始分辨率选择信息帧或视觉token。我们表明,可以用每帧分辨率来换取更密集的时间覆盖,而前端解码延迟取决于候选池的大小,而不是最终的token预算。针对多个VLM和长视频基准的实证研究得出了三个结果:在匹配的token预算下,密集的低分辨率采样优于稀疏的原始分辨率采样;对分辨率敏感的任务受益于选定的高分辨率帧;前端解码在长达一小时的视频中占据主导地位。受这些发现的启发,我们引入了 LoHi,这是一种无需训练单通道框架,它通过VLM的本机视频和图像路径将密集的低分辨率视频流与稀疏的高分辨率图像帧结合起来。 LoHi-Anchor 使用编解码器 I 帧元数据选择高分辨率帧,而 LoHi-SemDiv 使用查询相关性和 CLIP 功能上的视觉多样性。在三个长视频基准测试中,LoHi 在匹配的token预算下比原始分辨率基线提高了 10.6 个百分点,比之前最强的效率方法提高了 5.2 个百分点。它还可以将长达一小时的视频的前端解码延迟降低多达 7 倍。项目页面:https://sixundong.com/projects/lohi

重新思考长视频效率:帧、像素和前端延迟的联合分配视角的原论文方法或结果图
图 3:LoHi 框架概述。与之前在原始分辨率路径中进行修剪或选择的工作 (a) 相比,LoHi (b) 将一个解码视频分解为两个互补的流:通过视频路径的密集低分辨率 Lo-V 和通过图像路径的稀疏高分辨率 Hi-I。 (c) 显示了 LoHi-SemDiv 选择器,它通过贪婪 MAP 选择 Hi-I 索引。