论文
走向一对多的时序定位
Towards One-to-Many Temporal Grounding
摘要
时序定位(TG)旨在定位与文本查询相对应的视频片段。先前的研究主要集中在单片段检索。然而,现实场景通常需要为单个查询本地化多个不相交的段——我们将这种设置称为一对多时序定位 (OMTG)。以前最先进的 MLLM 针对一对一设置进行了优化,但在这种情况下却举步维艰,由于缺乏事件基数感知,常常产生接近于零的分数。为了弥补这一差距,我们提出了一个具有三个关键贡献的系统解决方案。首先,我们建立了第一个全面的 OMTG 基准,引入计数精度 (C-Acc) 和有效时间 F1 (EtF1) 作为评估指标。其次,我们通过复杂的构建流程整理了包含 56k 个样本的高质量 OMTG 数据集。第三,我们开发了专门为 OMTG 设计的新颖的时间和文本描述奖励函数。特别是,文本描述奖励利用密集视频字幕的思想链推理来明确指导策略优化,以实现精确性和完整性。大量实验表明,我们的模型在 OMTG Bench 上达到了 43.65% 的最新最先进 EtF1,分别比 Gemini 2.5 Pro 和 Seed-1.8 好 15.85% 和 15.61%。项目页面:https://insomniaaac.github.io/OMTG/