论文
ProMMSearchAgent:使用面向流程的奖励进行训练的通用多模式搜索代理
ProMMSearchAgent: A Generalizable Multimodal Search Agent Trained with Process-Oriented Rewards
摘要
基于结果的监督的极度稀疏性和实时网络环境的不可预测性从根本上阻碍了通过强化学习来训练多模态代理以进行知识密集型视觉推理。为了解决这些算法和环境瓶颈,我们引入了 ProMMSearchAgent,为多模态搜索建立了一种新颖的 Sim-to-Real 训练范例。我们将策略学习解耦到确定性的本地静态沙箱中。至关重要的是,为了在这种受限的环境中有效学习,我们提出了一种内省的、面向过程的奖励。通过探测代理自身的参数知识边界,我们生成密集的行为元数据,明确奖励正确的认知决策,仅在视觉或事实上不确定时启动多模式或文本搜索。大量实验表明,我们本地训练的策略可以将零样本转移到实时 Google 搜索 API。 ProMMSearchAgent 实现了新的 SOTA 性能,在 FVQA 测试中优于 MMSearch-R1 +5.1%,在 InfoSeek 上优于 MMSearch-R1 +6.3%,在 MMSearch 上优于 MMSearch-R1 +11.3%。