论文
CoEvoWhen:超长视频时间grounding的策略工具协同进化
CoEvoWhen: Policy-Tool Coevolution for Ultra-Long Video Temporal Grounding
摘要
超长视频时间基础需要在有限的视觉预算下平衡远程证据搜索和细粒度事件理解,但现有的 Agentic 方法仍然很大程度上依赖于预定义的策略和工具功能。受此启发,我们提出了一种新颖的策略工具协同进化框架,该框架从 VLM 的 Agentic 推理轨迹共同进化高级策略和可执行媒体工具,形成可重用的技能,而无需更新模型参数。在进化过程中,外部技能更新器在长视频时间基础中提取可转移的任务经验,从而完善基于远程图像和细粒度视频观察的编排。除了这些策略更新之外,更新程序还利用其编码功能来升级现有工具或创建新工具,使这些工具适应长视频证据采集。配备了进化的技能,VLM 在进化的策略的指导下自主编排工具,协调图像和视频观察以进行 Agentic 推理,而无需依赖单独的、更强大的规划模型。涵盖五个基准和三个 VLM 的广泛实验表明,策略工具协同进化持续提高了超长视频的时间基础准确性,同时降低了推理时的视觉词元成本,并且进化后的技能在一般长视频 QA 上产生了显着的性能提升,而无需额外的特定任务进化,这证明了我们的长视频理解框架的有效性和通用性。