论文
QCA:用于长视频理解的查询和内容感知关键帧选择
QCA: Query- and Content-Aware Keyframe Selection for Long Video Understanding
摘要
视频理解经常受到严重的时间冗余的困扰,其中处理密集的帧序列在语义上效率低下且计算成本昂贵。当只有一小部分帧与给定查询真正相关时,这一挑战会进一步放大。在本文中,我们提出了一种查询和内容感知(QCA)关键帧选择框架,该框架可以从长视频中选择紧凑但信息丰富的帧集。 QCA首先将视频划分为时间片段,通过联合建模查询相关性和内容偏差来估计每个片段的信息贡献,并动态地将关键帧预算分配给每个片段。在每个片段中,QCA 锚定在与查询最相关的框架上,并迭代地合并其他框架以最大限度地提高多样性,同时保持与查询的高度语义相关性。至关重要的是,我们的方法不需要额外的训练,并且可以无缝集成到现有的 Video-LLM 中。跨多个长视频理解基准的大量实验表明,我们提出的方法实现了最先进的性能并具有很强的泛化能力。例如,QCA 使用 128 帧在 LongVideoBench 上实现了 67.8%,而 GPT-4o 使用 256 帧实现了 66.7%。我们的代码可以在 \href{https://github.com/hktk07/QCA}{GitHub} 中找到。