论文

REZE:基于识别的视频时序定位零样本提取

REZE: Recognition-Based Zero-Shot Extraction for Video Temporal Grounding

模型推理推理策略与问题分解

摘要

视频时间基础(VTG)是指识别视频中与给定自然语言查询相对应的时间间隔的任务。常见的零样本策略要求大型视觉语言模型 (VLM) 直接生成开始和结束时间戳,因此结果在很大程度上取决于模型的设计和训练,并且不同 VLM 的定位精度差异很大。因此,我们提出了基于 REcognition 的零样本提取(REZE),这是一种简单的 无需训练 方法,它将视频分割成短片,向模型询问查询的剪辑级别置信度得分,并使用确定性算法将所得得分曲线转换为任务所需的输出。由于时间聚合是在模型外部执行的,因此 REZE 适应不同的任务输出,从单间隔和多间隔时刻检索到高亮检测。在 QVHighlights 上,REZE 将最佳报告的 无需训练 时刻检索 mAP 从 38.23 提高到 40.32,而在高亮检测上,它达到 44.18 mAP 和 73.41 HIT@1,在 无需训练 方法中建立了新的最先进技术。在 QVHighlights 测试中,其 HIT@1 的表现也优于所有完全监督的 SoTA。我们在来自三个模型系列的七个骨干上评估 REZE。在 Charades-STA 和 QVHighlights 上,它在每个可用的比较中都优于直接时间戳生成。我们进一步观察到,通过 REZE,上一代型号可以接近其系列中较新型号的本机性能。