论文

DSE-VTG:通过视觉与文本双侧增强实现无需任务训练的视频时序定位

DSE-VTG: Dual-Side Enhancement for Training-Free Video Temporal Grounding

模型推理推理验证与自校正

摘要

文本引导视频时序定位(VTG)旨在基于文本查询定位未修剪视频中的相关片段,但收集密集的时间注释和训练特定于任务的模型在分布偏移下仍然成本高昂且脆弱。最近的 无需训练 VTG 方法通过直接匹配预训练的视觉语言表示来缓解这个问题,但它们仍然面临两个基本信息瓶颈:逐帧视觉编码忽略了时间动态,而固定查询嵌入无法解决查询歧义。为了解决这些问题,我们提出了 DSE-VTG,一个 \underline{D}ual-\underline{S}ide \underline{E} 增强框架,无需任何特定于任务的训练即可解决这两个问题。在视觉方面,多尺度相似性融合 (MSF) 将帧级和剪辑级相似性组合成统一的、时间感知的相似性配置文件。在文本方面,查询级测试时适应 (Q-TTA) 优化了轻量级附加偏移,以在测试时使查询嵌入适应视频,而无需微调主干或调用外部 大语言模型。对三个标准和两个 OOD 基准的大量实验表明,DSE-VTG 在 无需训练 方法中实现了最先进的性能。在 Charades-STA 上,它比最强的现有 无需训练 方法将 mIoU 提高了 5.61 点。在分布转移下,DSE-VTG 在 Charades-CG Novel-Word 上达到 50.86 mIoU,超过最强监督基线 2.76 mIoU。我们的代码将在接受后发布。