论文
DR-MMSearchAgent:多模态搜索代理的深化推理
DR-MMSearchAgent: Deepening Reasoning in Multimodal Search Agents
摘要
代理多模式模型因其利用外部工具来处理复杂任务的能力而受到广泛关注。然而,据观察,此类智能体经常会遇到过早的交互崩溃,这是由两个主要原因造成的:1)经常附加在最后一个词元上的最终奖励阻止了区分具有探索行为的轨迹的优势; 2)过度冗余的上下文阻碍了智能体吸收有用的反馈。为了解决这些问题,我们提出了深化推理 MMSearchAgent,该框架利用结构邻近性从整个批次中的完整交互轨迹中获取优势信号,从而进一步鼓励生成不同长度的轨迹,即使包含相同的正确答案。此外,采用差异化高斯奖励来动态校准交互容忍度,从而保证信息可靠性并减少冗余。为了支持多轮交互训练,我们构建了一个多步骤深度推理数据集,包括 3602 个高质量 QA 对,至少有 3 个推理步骤。大量实验表明,我们的方法实现了最先进的性能,在 FVQA 测试中比 MMSearch-R1 高出 8.4$\%$。