论文

MSRL:通过多阶段强化学习扩展生成多模态奖励模型

MSRL: Scaling Generative Multimodal Reward Modeling via Multi-Stage Reinforcement Learning

模型训练奖励建模与过程监督

摘要

多模式奖励模型的最新进展很大程度上是由判别性方法到生成性方法的范式转变所推动的。在此进展的基础上,最近的研究进一步利用可验证奖励(RLVR)的强化学习来增强多模式奖励模型(MRM)。尽管取得了成功,但基于 RLVR 的训练通常依赖于标记的多模态偏好数据,而获取这些数据的成本高昂且需要大量劳动力,因此难以扩展 MRM 训练。为了克服这一限制,我们提出了一种多阶段强化学习(MSRL)方法,该方法可以利用有限的多模态数据实现 MRM 的可扩展 RL。 MSRL 取代了传统的基于 RLVR 的训练范式,首先从大规模文本偏好数据中学习可泛化的奖励推理能力,然后通过基于描述和完全多模态的强化学习阶段将该能力逐步转移到多模态任务。此外,我们引入了跨模式 知识蒸馏 方法来提高 MSRL 内的偏好泛化。大量实验表明,MSRL 有效地扩展了基于 RLVR 的生成 MRM 训练,并显着提高了其在视觉理解和视觉生成任务中的性能(例如,在 VL-RewardBench 上从 66.6% 提高到 75.9%,在 GenAI-Bench 上从 70.2% 提高到 75.7%),而不需要额外的多模态偏好注释。我们的代码位于:https://github.com/wangclnlp/MSRL。