论文
CORA:通过一致性导向的推理对齐来分析和弥合多模式 RLVR 中的思维与答案差距
CORA: Analyzing and bridging thinking-answer gap in Multimodal RLVR via Consistency-Oriented Reasoning Alignment
摘要
带有可验证奖励的强化学习(RLVR)成功激发了大语言模型的推理能力,推动其扩展到多模态场景。现有方法主要侧重于提高推理痕迹的视觉覆盖率和减轻视觉幻觉,但低估了推理过程与最终答案之间的语义不一致。在本文中,我们深入研究了大型视觉语言模型 (LVLM) RLVR 中思维与答案不一致的问题,对整个组相对策略优化 (GRPO) 训练过程中收集的首次展示和 RLVR 后评估输出进行了全面分析,表明该问题在训练期间持续存在,并且在推理期间仍然存在。在分析的推动下,我们提出了面向一致性的推理对齐(CORA),它通过轻量级的即插即用一致性奖励模型将思维-答案语义一致性引入到RLVR中,并进一步结合混合奖励优势分裂(HRAS)来稳定地协调任务和一致性优化。跨代表性多模态推理基准和主流 LVLM 的大量实验表明,CORA 提高了任务性能,同时有效缓解了思维与答案的不一致,从而产生更忠实的推理痕迹。