论文

VideoSearcher:通过强化学习利用多工具代理推理增强视频深度研究

VideoSearcher: Empowering Video Deep Research with Multi-Tool Agentic Reasoning via Reinforcement Learning

智能体系统Agent 工具调用

摘要

视频理解正在超越封闭环境感知,转向开放世界的证据探索,这种范式被形式化为视频深度研究(VDR)。然而,现有的多模态搜索代理主要针对静态图像,而当前的 VDR 基准依赖于以文本为中心的检索,从而丢弃了关键的视觉信息。为了解决这些限制,我们提出了 VideoSearcher,这是一种闭环代理框架,可为视觉语言模型提供 VDR 的多工具推理。 VideoSearcher 将时间定位、空间聚焦和多模态搜索统一在单个推理轨迹中,使代理能够逐步视觉定位线索、检索相关证据并综合答案。为了优化知识密集型推理轨迹,我们提出了双分支序列策略优化(BiSPO),这是一种强化学习算法,可将工具调用优化与答案准确性优化解耦。这种设计为循证推理和有目的的工具使用提供了稳定的学习信号。此外,我们构建了 VideoSearch-QA,这是第一个旨在评估开放世界视频信息基础和基于多模态搜索的推理的基准。大量实验表明,VideoSearcher 在各种面向搜索和多模态理解基准中显着优于先前的开源代理基线。