论文
TF-PRVR:免训练的部分相关视频检索
TF-PRVR: Training-Free Partially Relevant Video Retrieval
摘要
部分相关视频检索 (PRVR) 旨在检索包含与给定文本查询相关的时刻的未修剪视频。尽管最近取得了进展,现有的 PRVR 方法仍面临两个关键限制:导致语义稀释的固定视频分解方案,以及特定任务训练引起的源域过度拟合。在本文中,我们提出了 TF-PRVR,这是第一个 PRVR 的 无需训练框架。 TF-PRVR 利用冻结的视觉语言特征来构建视频特定的分层表示。它从帧级特征中导出时间语义信号,并应用基于频率的多尺度分析来识别自适应时间边界,生成具有连贯事件级语义的分层片段。基于这些片段,TF-PRVR 构建了一个统一的多尺度图,并在时间和语义相关的节点之间传播查询相关性。然后,时刻感知评分策略会聚合跨尺度的时间对齐相关性,强调一致支持的时刻,同时抑制孤立的错误响应。没有特定于任务的训练,TF-PRVR 保留了预训练视觉语言模型的通用对齐功能,并避免了特定于数据集的过度拟合。大量的实验证明了具有不同视觉和时间特征的数据集的一致性能,这为 无需训练 PRVR 提出了一个实用的方向。
