论文

VideoResearchAgent:用于开放网络视频研究的扎根任务综合和 Sim-to-Real RL

VideoResearchAgent: Grounded Task Synthesis and Sim-to-Real RL for Open-Web Video Research

模型训练强化学习RLVRAgentic RL

摘要

现有的深度研究智能体主要是针对基于文本和图像的网络资源而设计的,而视频推理系统通常假设提前提供了相关视频。我们研究开放网络视频研究,其中智能体必须自主发现相关视频,导航其时间内容,并在视觉证据中找到答案。 训练等大规模的智能体具有挑战性,因为实时视频交互缓慢且不可靠,而固定的本地模拟可能会导致无法传输到开放网络的特定于检索的快捷方式。我们引入了 VideoResearchAgent,这是一个可扩展的训练框架来应对这些挑战。首先,我们引入可控任务合成管道,从带时间戳的视觉证据合成多跳研究任务,同时过滤纯文本快捷方式。其次,我们构建了一个现场对齐的本地视频模拟器,它保留面向部署的搜索和观看交互,同时将视频搜索加速 34.5-64.6 倍。第三,我们引入了检索域随机GRPO(RDR-GRPO),它在训练期间使候选排名、干扰项、元数据和结果结构多样化,以减少对模拟检索的过度拟合。在 Video-BrowseComp 上,使用 Qwen3.5-4B 训练的 VideoResearchAgent 达到了 40.48% 的准确率,与 Gemini-3-Flash-Preview 相当,同时相对于未经训练的模型,累积 API-token消耗减少了 74.9%。这些结果共同为开放网络视频研究建立了准确、高效的训练配方。

VideoResearchAgent:用于开放网络视频研究的扎根任务综合和 Sim-to-Real RL的原论文方法或结果图
图 1:VideoResearchAgent 概述。 VLM反复搜索、观看、聚合和交叉验证视频证据。