论文

具有强大奖励的强化学习

Reinforcement Learning with Robust Rubric Rewards

模型训练奖励建模与过程监督

摘要

虽然具有可验证奖励的强化学习(RLVR)对于确定性可检查任务是有效的,但许多视觉语言任务是部分可验证的,需要多标准监督(例如感知细节、推理步骤和约束)。 Rubrics 为这种细粒度监督提供了一个自然的界面,但它们的有效性取决于在线 RL 期间的执行准确性。我们提出了具有鲁棒性奖励的强化学习 ($\text{RLR}^3$),将 RLVR 从任务级验证扩展到标准级验证。 $\text{RLR}^3$ 通过两个执行路径路由特定于实例的规则:与确定性验证器配对的 LLM-as-an-extractor,或用于不可验证标准的 LLM-as-Judge。为了确保忠实的评分,$\text{RLR}^3$引入了最小曝光策略,该策略掩盖了来自提取器的基本事实和来自评委的图像。此外,$\text{RLR}^3$ 采用分层聚合来优先考虑基本标准而不是附加标准,并减轻轨迹采样组内的分数饱和。在 Qwen3-VL-30B-A3B 的 15 个基准测试中进行评估,$\text{RLR}^3$ 始终优于 RLVR,比基本模型提高了 4.7 个百分点,并超过了官方指导思维模型的差距。受控审计证实了我们的确定性验证和最小程度的暴露显着减少了可利用的误报。