论文
重新思考长视频效率:帧、像素和前端延迟的联合分配视角
Rethinking Long-Video Efficiency: A Joint Allocation Perspective on Frames, Pixels, and Front-End Latency
摘要
使用视觉语言模型(VLM)进行高效的长视频理解通常被定义为以固定的原始分辨率选择信息帧或视觉token。我们表明,可以用每帧分辨率来换取更密集的时间覆盖,而前端解码延迟取决于候选池的大小,而不是最终的token预算。针对多个VLM和长视频基准的实证研究得出了三个结果:在匹配的token预算下,密集的低分辨率采样优于稀疏的原始分辨率采样;对分辨率敏感的任务受益于选定的高分辨率帧;前端解码在长达一小时的视频中占据主导地位。受这些发现的启发,我们引入了 LoHi,这是一种无需训练单通道框架,它通过VLM的本机视频和图像路径将密集的低分辨率视频流与稀疏的高分辨率图像帧结合起来。 LoHi-Anchor 使用编解码器 I 帧元数据选择高分辨率帧,而 LoHi-SemDiv 使用查询相关性和 CLIP 功能上的视觉多样性。在三个长视频基准测试中,LoHi 在匹配的token预算下比原始分辨率基线提高了 10.6 个百分点,比之前最强的效率方法提高了 5.2 个百分点。它还可以将长达一小时的视频的前端解码延迟降低多达 7 倍。项目页面:https://sixundong.com/projects/lohi
