论文
用于视频理解的覆盖驱动自适应关键帧选择
Coverage-Driven Adaptive Keyframe Selection for Video Understanding
摘要
大型视觉语言模型(LVLM)的最新进展使得长视频理解和分析成为可能。然而,处理视频中的大量帧会产生大量的计算开销。现有方法通过在推理之前对帧查询相关性进行评分并相应地选择关键帧来降低 LVLM 推理成本。然而,相关帧的分布因查询而异,并且这些方法通常需要对数百或数千个帧进行评分。为了解决这个限制,我们提出了 CSES,一种 无需训练 语义关键帧选择器,它自适应地确定要评分的帧数和要选择的关键帧数。 CSES 估计帧查询相关性配置文件的突出程度,以指导主动采集并调整每个输入的时间覆盖范围。然后,它将关键帧选择制定为一个覆盖问题,共同考虑语义相关性、时间冗余和视觉冗余。主动采集和关键帧选择根据覆盖饱和度终止。选择目标是单调和子模的,可通过标准近似保证实现贪婪优化。在两个基准上使用四个 LVLM 进行的实验表明,与现有基线相比,我们的方法在保持准确性的同时,减少了 $4$-$13\times$ 的帧数,并选择了 $18.4\%$-$20.5\%$ 的输入关键帧。 CSES 在帧选择方面比基线进一步实现了 $3.1$-$5.4\times$ 加速。