论文

OpenSearch-VL:前沿多模式搜索代理的开放配方

OpenSearch-VL: An Open Recipe for Frontier Multimodal Search Agents

智能体系统Agent 工具调用

摘要

深度搜索已成为前沿多模态智能体的关键能力,使模型能够通过主动搜索、证据验证和多步推理来解决复杂问题。尽管取得了快速进展,但顶级多模态搜索代理仍然难以复制,这很大程度上是由于缺乏开放的高质量训练数据、透明的轨迹合成管道或详细的训练方法。为此,我们引入了 OpenSearch-VL,这是一种完全开源的配方,用于通过代理强化学习来训练前沿多模态深度搜索代理。首先,我们策划了一个专用管道,通过维基百科路径采样、模糊实体重写和源锚点视觉基础来构建高质量的训练数据,这共同减少了捷径和一步检索崩溃。基于这个流程,我们策划了两个训练数据集:用于 SFT 的 SearchVL-SFT-36k 和用于 RL 的 SearchVL-RL-8k。此外,我们设计了一个多样化的工具环境,统一了文本搜索、图像搜索、OCR、裁剪、锐化、超分辨率和透视校正,使智能体能够将主动感知与外部知识获取结合起来。最后,我们提出了一种多轮致命感知 GRPO 训练算法,该算法通过屏蔽故障后标记来处理级联工具故障,同时通过单方面优势钳位保留有用的故障前推理。基于此配方,OpenSearch-VL 提供了显着的性能提升,在七个基准测试中平均提高了 10 点以上,并且在多项任务上取得了与专有商业模型相当的结果。我们将发布所有数据、代码和模型,以支持多模式深度搜索代理的开放研究。