论文

WeAgent-MMSearch:多模态搜索智能体的原生文本与视觉交互

WeAgent-MMSearch: Native Text-Vision Interaction for Multimodal Search Agents

模型训练强化学习RLVR

摘要

多模态搜索代理利用来自开放网络的新出现的长尾证据扩展参数知识。然而,许多现有的代理搜索环境通常仅以文本形式公开检索到的证据,并省略后续上下文中工具返回的图像,从而将基于视觉的轨迹减少为纯文本推理。长视野交互还加剧了工具调用、响应长度、超时和预算失败,这可能会丢弃可挽救的轨迹、浪费采样轨迹计算并干扰策略更新。为了解决这些问题,我们引入了 WeAgent-Harness,这是一种多模态智能体运行框架,支持本机文本视觉交互和运行时恢复。检索到的图像接收持久的磁盘引用,允许模型在整个轨迹中检查、处理和引用它们。基于此工具,我们开发了 WeAgent-MMSearch,这是一个涵盖数据构建、代理后训练和多模态部署的集成系统。对于数据构建,强大的 MLLM 使用 WeAgent-Harness 来发现、综合和验证 MMSearch 式任务并收集专家轨迹。在训练后,我们的故障感知 GSPO (FA-GSPO) 恢复可挽救的异常采样轨迹并过滤无效的采样轨迹,以改进有界多模态规划和搜索。我们还引入了 VisTarget-Bench,这是一个经过 150 项任务的人工验证基准,它将每个问题与保留的目标图像配对,区分图像检索失败和视觉感知失败。对 VisTarget-Bench 和七个公共基准的评估表明,代理后训练将平均得分提高了 19.22 分,使我们的模型能够超越类似规模的开源模型和参数数量大约十倍的竞争对手模型。

WeAgent-MMSearch:多模态搜索智能体的原生文本与视觉交互:论文配图
图1:我们署-MMSSearch的基准业绩