论文

TF-PRVR:免训练的部分相关视频检索

TF-PRVR: Training-Free Partially Relevant Video Retrieval

上下文与知识检索增强

摘要

部分相关视频检索 (PRVR) 旨在检索包含与给定文本查询相关的时刻的未修剪视频。尽管最近取得了进展,现有的 PRVR 方法仍面临两个关键限制:导致语义稀释的固定视频分解方案,以及特定任务训练引起的源域过度拟合。在本文中,我们提出了 TF-PRVR,这是第一个 PRVR 的 无需训练框架。 TF-PRVR 利用冻结的视觉语言特征来构建视频特定的分层表示。它从帧级特征中导出时间语义信号,并应用基于频率的多尺度分析来识别自适应时间边界,生成具有连贯事件级语义的分层片段。基于这些片段,TF-PRVR 构建了一个统一的多尺度图,并在时间和语义相关的节点之间传播查询相关性。然后,时刻感知评分策略会聚合跨尺度的时间对齐相关性,强调一致支持的时刻,同时抑制孤立的错误响应。没有特定于任务的训练,TF-PRVR 保留了预训练视觉语言模型的通用对齐功能,并避免了特定于数据集的过度拟合。大量的实验证明了具有不同视觉和时间特征的数据集的一致性能,这为 无需训练 PRVR 提出了一个实用的方向。

TF-PRVR:免训练的部分相关视频检索:论文原图
图 1:(a) 现有 PRVR 方法的双分支框架 Dong 等人。 (2022);月亮等人。 (2025b);王等人。 (2024b);李等人。 (2025);月亮等人。 (2025a)。 (b) 固定大小剪辑聚合引起的语义稀释。 (c)使用 CLIP-L Radford 等人对三个数据集(TVR Lei 等人(2020)、ActivityNet Captions (Act) Krishna 等人(2017)、Charades-STA(Cha)Gao 等人(2017))进行跨数据集比较(R@1 (%))。 (2021) 特点。每组显示现有方法的域内(例如 Act$\rightarrow$Act)和跨域(例如 TVR$\rightarrow$Act)结果 Wang 等人。 (2024b);月亮等人。 (2025b)、零样本 CLIP 和我们的 无需训练 TF-PRVR。 (彩色效果最佳。)