论文

得分更高,回答更差:通过协议级评分标准缓解基于评分标准的强化学习中的奖励作弊行为

Scoring Higher, Answering Worse: Mitigating Reward Hacking in Rubric-Based RL via Protocol-Level Rubrics

模型训练奖励建模与过程监督

摘要

基于 Rubric 的强化学习 (Rubric-RL) 在不存在验证器的情况下训练语言模型。评审检查评分标准的每个标准,并将判决汇总为奖励,通常是加权总和。我们证明这种加法聚合是弱点。在总和下,标准是相互补偿的:一项错过了重要决定的政策可以用没人要求的建议买回积分。在临床咨询中,这样的政策得分较高,但回答较差。标题覆盖率上升,而坚持的医生标准的适当性却低于未经训练的模型。医疗标准不应该受到指责。分组后,他们必须保持一致,同样的标准,字面意思不变,挽回三分之一的损失;较短的答案几乎没有恢复。因此,我们提出了协议级Rubrics (ProRubric),它保留了标准的要求并改变了它们的聚合方式。它将清单分为几个协议级维度。仅当维度的所有条件均成立且其失败子句未触发时,该维度才算数。分组离线完成一次,并使优化器保持不变。 ProRubric 在不损失覆盖范围的情况下将适当性提高了 10.8 分,并且在两个尺度上都具有最佳的七个基准平均值。奖励有效性不仅取决于评分标准验证的内容,还取决于其聚合方式。代码可在 https://github.com/Estrellajer/ProRubric 获取