论文

Video-DeepResearch:迈向下一代多模式深度研究代理

Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent

智能体系统Agent 架构与控制循环

摘要

我们引入了视频深度研究(Video-DR),将多模式代理从静态图像扩展到连续视频流,这种设置需要密集的时空基础和开放网络探索。初步评估揭示了当前模型中的两个关键瓶颈:(1)模态偏差,即智能体绕过视觉工具转而支持文本搜索;(2)参数化知识泄漏,即模型依赖于内部记忆而不是真正的工具增强执行。为了应对这些挑战,我们提出了 Video-DR,它具有解耦的感知探索管道和分阶段工具解锁,可在网络检索之前强制进行详尽的跨帧视觉基础。我们的框架采用两阶段训练方案:有监督的 微调,然后是组相对策略优化(GRPO),从而实现突破模仿学习上限的自主探索。此外,我们还策划了 Video-DR-Bench,这是一个由 200 个复杂的多跳 VQA 实例组成的人类与人工智能协作基准测试。实证结果表明,我们的 Video-DeepResearch-35B-A3B 建立了 64.0% 的平均准确率,超过专有的 Claude-4.5-Sonnet (59.0%) 5.0 个百分点,并且显着优于 GPT-5 (52.5%) 和 Gemini 2.5 Pro (57.5%)。 30B-A3B 变体达到了 59.3%,与 Claude-4.5-Sonnet 竞争,即使在紧凑的规模下也证明了我们的训练范例的有效性。代码:https://github.com/Osilly/Vision-DeepResearch。