论文
检索任何相关时刻:广义时刻检索的基准和模型
Retrieving Any Relevant Moments: Benchmark and Models for Generalized Moment Retrieval
摘要
视频时刻检索 (VMR) 旨在定位视频中与自然语言查询相对应的时间片段,但通常假设每个查询只有一个匹配时刻。这种假设在现实场景中并不总是成立,其中查询可能对应于多个时刻或不对应于任何时刻。因此,我们制定了广义矩检索(GMR),这是一种统一的设置,需要检索完整的相关矩集或预测空集。为了能够系统地研究 GMR,我们引入了 Soccer-GMR,这是一个基于具有挑战性的足球视频的大型基准,该视频反映了一般 GMR 场景,并具有现实的负面和正面查询。该基准是通过持续时间灵活的半自动化管道和人工验证构建的,可实现可扩展的数据生成,同时保持高注释质量。我们进一步设计了一个统一的评估协议,其中包含针对空集拒绝、正查询定位和端到端 GMR 性能量身定制的补充指标。最后,我们在两个建模范例之间建立了强大的基线:用于判别性 VMR 模型的轻量级即插即用 GMR 适配器,以及用于 微调 多模态 大语言模型 (MLLM) 的 GMR 定制 GRPO 奖励。广泛的实验显示了所有指标的一致增益,并暴露了当前方法的关键局限性,将 GMR 定位为视频语言理解的更现实和更具挑战性的基准。