论文

MM-Doc-R1:通过多轮强化学习训练长文档视觉问答的代理

MM-Doc-R1: Training Agents for Long Document Visual Question Answering through Multi-turn Reinforcement Learning

模型训练强化学习

摘要

传统的检索增强生成 (RAG) 系统由于其单遍检索,常常难以应对长文档的复杂多跳查询。我们引入了 MM-Doc-R1,这是一种新颖的框架,它采用代理的视觉感知工作流程,通过迭代信息发现和合成来解决长文档视觉问题解答。为了激励智能体的信息搜索能力,我们提出了基于相似性的策略优化(SPO),解决了现有多轮强化学习(RL)算法(如 GRPO)中的基线估计偏差。我们的核心见解是,在多轮强化学习中,两个轨迹在语义上越相似,它们的共享基线估计就越准确。利用这一点,SPO 通过跨多个轨迹的奖励的相似性加权平均来计算更精确的基线,这与 GRPO 不同,GRPO 不适当地将初始状态的基线应用于所有中间状态。这为我们的智能体提供了更稳定、更准确的学习信号,从而实现超越 GRPO 的卓越训练性能。我们在 MMLongbench-Doc 基准测试上的实验表明,MM-Doc-R1 的性能比之前的基线高出 10.4%。此外,SPO 表现出优于 GRPO 的性能,Qwen3-8B 的结果提高了 5.0%,Qwen3-4B 的结果提高了 6.1%。这些结果凸显了我们的集成框架和新颖的训练算法在推进复杂、长文档视觉问答的最新技术方面的有效性。