论文
面向视觉原生多模态深度搜索代理的 同策略 数据演化
Towards On-Policy Data Evolution for Visual-Native Multimodal Deep Search Agents
摘要
多模态深度搜索需要代理通过在不断变化的文本和视觉上下文中链接搜索、工具使用和视觉推理来解决开放世界问题。当前系统有两个瓶颈。首先,现有的工具使用工具将搜索、浏览或转换返回的图像视为瞬态输出,因此中间的视觉证据无法被后续工具重新使用。其次,训练数据通常是通过固定的管理方法构建的,无法跟踪目标代理不断发展的能力。为了应对这些挑战,我们首先引入以图像库参考协议为中心的视觉原生代理工具,它将每个工具返回的图像注册为可寻址参考,并使中间视觉证据可由以后的工具重用。在此工具之上,同策略 数据演进 (ODE) 运行一个闭环数据生成器,该生成器在所训练的策略的采样轨迹过程中不断完善自身。这种每轮的细化使得每轮的数据目标都是当前策略仍然需要学习的。同一框架支持不同的监督 微调 数据和策略感知强化学习数据管理,涵盖目标代理的整个训练生命周期。在 8 个多模态深度搜索基准测试中,ODE 将 Qwen3-VL-8B 代理平均从 24.9% 提高到 39.0%,在标准代理工作流设置中超过了 Gemini-2.5 Pro (37.9%)。在 30B 时,ODE 将平均分数从 30.6% 提高到 41.5%。进一步的分析验证了图像库重用的有效性,特别是在需要迭代视觉细化的复杂任务上,而采样轨迹反馈演化比静态合成产生更扎实的 SFT 轨迹和更好的策略匹配 RL 任务。