论文

OneSearch-VL:图像和视频的统一多模态深度研究代理

OneSearch-VL: Unified Multimodal Deep Research Agent for Image and Video

模型训练智能体系统奖励建模与过程监督合成数据Agent 架构与控制循环

摘要

单图像、多图像和视频深度研究需要不同的视觉操作,但共享视觉基础、外部检索和事实合成的工作流程。一个关键的挑战是保留链接本地化视觉锚点、实体关系、源支持的事实和答案生成操作的依赖关系。我们引入了 OneSearch-VL,这是一个以视觉证据图(VGEG)为中心的统一代理,它将这些依赖关系编码为数据构建、流程监督和操作级评估的共享任务级参考。我们基于 VGEG 的数据引擎构建并验证多图像和视频问题并过滤专家轨迹。使用这些数据,我们分别为 SFT 和 RL 组装了 OneSearch-VL-SFT-110K 和 OneSearch-VL-RL-10K。我们进一步从 VGEG 注释中推导出证据感知视觉接地评分奖励 (EVGR),以监督强化学习期间的证据可追溯性和视觉接地。为了进行细粒度的评估,我们构建了 OneSearch-MI-Bench 和 OneSearch-Video-Bench,通过编码的研究操作来组织问题 在他们的 VGEG 中。实验表明,OneSearch-VL-8B 比 Qwen3-VL-8B 有所改进,在两个新基准测试中工具访问能力分别提高了 20.2 和 17.6 个百分点,同时在 7 个图像基准测试和 VideoDR 上也取得了显着的进步。项目存储库:https://github.com/appletea233/OneSearch-VL