论文
用强化学习激发多模态推理Agent的自我验证
Eliciting Self-Verification in Multimodal Reasoning Agents with Reinforcement Learning
摘要
推理智能体越来越依赖外部工具(例如网络搜索)来回答复杂的查询。 GRPO 等强化学习 (RL) 微调算法改进了纯文本语言模型中的长式推理,特别是在编码和数学方面。然而,在多模态智能体中使用可靠的工具仍然具有挑战性,因为模型必须解释文本和图像,同时整合嘈杂的检索到的证据,通常是在稀疏的结果级监督下,没有明确的验证信号。我们提出了通过强化学习进行自我验证(SVRL),这是一种仅限 RL 的微调框架,可训练多模态智能体在自己的推理轨迹中验证和过滤检索到的证据,从而减少推理时对外部验证者的依赖。 SVRL 还引入了搜索感知惩罚,以阻止不必要的工具调用;还引入了查询多样性奖励,以鼓励多样化、格式良好的搜索查询,从而提供有关搜索时间和搜索内容的细粒度反馈。仅在 5{,}000 个视觉问答示例上使用 SVRL 微调 Qwen-2.5-VL-7B,即可在跨基准的多跳 VQA 泛化和工具效率方面获得一致的收益。总体而言,SVRL 缩小了紧凑型智能体和更大的专有模型之间的差距,同时需要大幅降低训练和推理成本。