论文
超越何处:多模态 RLVR 的轨迹引导强化学习
Beyond Where to Look: Trajectory-Guided Reinforcement Learning for Multimodal RLVR
摘要
多模态 大语言模型 (MLLM) 的可验证奖励强化学习 (RLVR) 的最新进展主要集中在提高最终答案的正确性和加强视觉基础上。然而,一个关键的瓶颈仍然存在:尽管模型可以关注相关的视觉区域,但它们往往无法有效地将视觉证据纳入后续推理,导致推理链缺乏视觉事实的基础。为了解决这个问题,我们提出了轨迹引导强化学习(TGRL),它指导策略模型使用来自更强模型的专家推理轨迹将视觉证据集成到细粒度推理过程中。我们进一步引入词元级重新加权和轨迹过滤,以确保稳定有效的策略优化。对多个多模态推理基准的大量实验表明,TGRL 持续提高推理性能,并有效弥合视觉感知和逻辑推理之间的差距。