论文
QSVideo:用于视频理解的查询条件语义时间检索
QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding
摘要
视觉语言模型(VLM)在视频理解中的性能随着视频时长的增加而下降,因为与查询无关的视频时刻会混淆它们的语言组件。多模态检索已成为视频理解的重要组成部分,通过本地化关键视觉证据来应对这一挑战。然而,现有的多模态检索方法存在相关性估计偏差、多样性有限和时间崩溃等问题。在本文中,我们提出了 QSVideo,这是一个统一的框架,可以系统地解决视频检索中的相关性、多样性和时间建模问题。我们首先引入一个查询条件语义排名器 QSRanker,它将任意问题重新表述为检索友好的查询,并沿着对象、动作和位置维度估计结构化相关性。在此基础上,我们设计了 QSRetrieval 来共同优化相关性和多样性,以实现信息更丰富的框架选择。此外,我们提出了针对长视频和流视频的时间对齐策略,以提高证据召回率。对长视频和流视频基准的大量实验表明,QSVideo 在严格的帧限制约束下极大地增强了视频 VLM 性能。该代码可在 https://github.com/ human-analysis/QSVideo 获取。