论文

DART:零样本视频时间定位的难度自适应路由

DART: Difficulty-Adaptive Routing for Zero-Shot Video Temporal Grounding

模型推理测试时计算扩展

摘要

零样本视频时间时间定位 (VTG) 可以根据自然语言查询来定位未修剪视频中的事件,无需进行特定于任务的训练。现有的方法依赖于帧查询特征匹配,这足以满足简单事件的需求,但难以处理需要理解时间顺序和因果结构的复杂多阶段查询——我们将这种差异称为推理差距。我们提出了 DART(时间时间定位难度自适应路由),它通过将难度感知路由与大型视觉语言模型中的结构化推理相结合来弥补这一差距。查询条件决定点过程 (DPP) 具有双重作用:选择多样化的、与查询相关的关键帧作为时间证据,并提供谱熵作为难度指标。简单查询被路由到快速路径以进行直接预测,而复杂查询则遵循带有时间标记提示的慢速路径,它将本地化​​分解为全局事件分析、每帧时间角色注释和边界提取。在 Charades-STA 和 ActivityNet Captions 上,DART 在相同分布和多个分布外设置上实现了最先进的零样本性能,将 mIoU 比最强基线提高了 3.5 个点,同时使用的帧数减少了 7 倍以上。项目主页位于 https://dart-vtg.github.io/。