论文

IVR-R1:通过强化学习中的迭代视觉推理来细化轨迹

IVR-R1: Refining Trajectories through Iterative Visual-Grounded Reasoning in Reinforcement Learning

模型训练强化学习

摘要

通过强化学习(RL)的多模态 大语言模型 在复杂的视觉推理任务中表现出了卓越的能力,但它们在长视野多模态场景中仍然受到限制,经常遭受视觉幻觉和逻辑错误。当前的方法通常将高维视觉场景预编码为离散文本代理,以促进下游推理。然而,随着推理链的展开,文本和视觉场景之间固有的信息不对称往往会侵蚀视觉基础,导致推理误导和错误输出。为了解决这个问题,我们引入了 IVR-R1(迭代视觉基础推理),这是一种新颖的 RL 训练框架,可促进动态视觉重新对齐,主动纠正推理轨迹以指导策略优化。具体来说,通过利用奖励驱动的筛选机制来识别有缺陷的部署,IVR-R1 在多模式环境中执行细粒度、步骤级的错误归因。通过迭代地交叉引用中间推理状态与原始视觉先验,重新推理循环可以实现自动轨迹校正,有效地合成专家级演示,作为策略模型的高保真推理模板。我们在不同的多模态基准上进行的实验表明,IVR-R1 始终优于现有的强化学习方法,为在复杂的多模态推理中保持逻辑和视觉一致性建立了卓越的范式。