Rubric Dropout:在 Rubric-as-Reward RL 中缓解 奖励作弊 的简单方法
Rubric Dropout: A Simple Way to Mitigate Reward Hacking in Rubric-as-Reward RL
摘要
针对评分标准(由 LLM 法官评分的标准列表)的强化学习已成为针对没有确定性答案的任务对语言模型进行后训练的标准方法。然而,该标题是质量的固定代表,而不是对其的完整描述,并且针对它训练足够长的时间的政策将学会利用其中的差异。我们直接测量这一点。使用组相对策略优化(GRPO)在医学和科学评分标准上训练 Qwen3-8B,并使用训练法官和更强的更强的参考评判模型对分布外(OOD)基准进行评分,我们发现这两个分数在训练过程中存在差异。训练评委的分数不断攀升,而参考评判模型的分数达到峰值然后下降,在 HealthBench-Hard 上下降了 3 分,在 ResearchQA 上下降了 22 分。具有固定偏差的判断者会将参考评分曲线移动一个常数,而不是在训练分数上升时将其向下移动,因此散度是 奖励作弊,而不是判断噪声。我们提出了 Rubric Dropout,这是一种借鉴自神经元 dropout 的单行修复方法。在每一步中,我们都会在计算奖励之前随机删除评分标准的一个子集,因此该策略永远不会两次优化相同的评分标准。删除的子集在每个轨迹组之间共享,因此 GRPO 的组相对优势保持可比,并且评估始终使用完整的标准。将两个基准对上的无 dropout 与 30% 和 50% 的 dropout 进行比较,dropout 提高了每个匹配检查点的 OOD 参考分数(在 HealthBench-Hard 上+1 到 +2 分,在 ResearchQA 上+6 到 +7 分),降低了我们跟踪的两个黑客措施,并且在域中没有任何成本。横扫丢弃比例显示了 30-50% 的最佳点,而自然的替代方案(根据对训练的有用程度重新衡量标准)在我们的环境中比完全不干预表现得更差。