论文
长视频中的条件多事件时间定位
Conditional Multi-Event Temporal Grounding in Long-Form Video
摘要
多模态 大语言模型 在视频时间定位方面取得了快速进展,但现实世界的应用通常需要定位满足组合时间和空间条件的每个事件。现有的基准测试存在不足:它们仅定位每个查询的单个时刻,在没有时间条件的情况下进行计数,或者将基础和计数视为不相交的任务。我们引入了 CoMET-Bench,用于长格式视频中的条件多事件时间时间定位,包括跨 5 个现实世界域的 600 个视频的 2789 个查询,平均时长为 33.8 分钟,每个查询由 4 个时间条件、3 个空间条件和一个专用的否定查询子集组成。我们进一步提出了一个统一的评估协议,联合测量计数、时间定位和否定查询识别,包括一个新的拒绝 F1 指标,该指标可以防止懒惰的“始终为空”模型的琐碎游戏。对一系列广泛的 MLLM、基于代理和时间定位专用方法进行基准测试表明,现有方法距离解决此任务还很远。基于这些发现,我们提出了 CoMET-Agent,这是一个 无需训练 代理框架,它将任务重新表述为结构化搜索和聚合,纯粹通过结构推理将 F1@0.5 比 GPT-5 提高了 6.1%。故障分析进一步揭示了三个开放方向:细粒度实体跟踪、位置一致检索和因果事件配对。