论文
超越视频的思考:统一开放世界视频代理的视频推理和深入研究
Thinking Beyond Videos: Unifying Video Reasoning and Deep Research for Open-World Video Agents
摘要
开放世界的视频理解通常需要一个模型来定位稀疏的视觉证据并获取视频及其参数记忆中缺少的外部知识。虽然视频思考可以实现主动时间感知,而深度研究支持多步骤信息搜索,但这两种功能通常是单独开发的。我们推出了 VideoRover,这是一个统一的视频深度研究框架,可迭代地协调视频裁剪、多模态搜索和网页浏览。给定视频-问题对,VideoRover 使用每个工具结果来选择下一个操作,因此本地化视频剪辑指导外部检索,检索到的证据触发进一步的视频检查和验证。为了开发这种功能,我们构建了一个自动化数据管理管道,生成 26K 个经过验证的 SFT 轨迹和 3K 个具有挑战性的 RL 实例。我们还介绍了 VideoRover-Bench,这是一个按视频时长和研究难度分层的基准。 VideoDR 和 VideoRover-Bench 上的实验表明,我们的 VideoRover-8B-RL 在不使用工具的情况下,在直接应答设置中实现了与专有模型相当的性能,同时优于配备相同工具套件的大型开源模型。消融研究和训练动态进一步验证了主动视频基础、外部检索和长视野强化学习的互补作用。