论文

长达一小时的视频中的自然语言时间基础是一个搜索问题:基准和经验分解

Natural-Language Temporal Grounding in Hour-Long Videos is a Search Problem: A Benchmark and Empirical Decomposition

模型评测基准与评测资源

摘要

时间基础(针对视频自然语言查询返回间隔 $[t_s, t_e]$)是长视频的语言接口,但已在短视频上进行了研究;小时尺度自然语言基础的动态仍未得到充分探索。我们采取的立场是,在小时尺度上,绑定约束是搜索,而不是识别:Video-LLM 的瓶颈不是通过定位附近的事件,而是通过搜索长视频的相关区域(给定自然语言查询)来实现。为了测试这一点,我们发布了 ExtremeWhenBench,这是第一个开放的小时规模的基础基准(194 个视频中的 2,273 个查询,平均 75.7 分钟,最长 9 小时),具有开放形式的查询分布。每个打开的 Video-LLM 都会崩溃,而帧级检索基线的性能优于它们;失败分类将 85% 的失败归因于搜索;检索然后地面混合恢复比单片 Video-LLM 提高 6.7 倍——在开放域 QA 中镜像检索然后读取。