论文
C2:来自二元偏好的可扩展红字增强奖励模型
C2: Scalable Rubric-Augmented Reward Modeling from Binary Preferences
摘要
Rubric增强验证以明确的评估标准指导奖励模型,产生比单一模型验证更可靠的判断。然而,大多数现有方法需要昂贵的标题注释,限制了可扩展性。此外,我们发现标题生成很容易出现合作失败的情况;低质量的评价标准会积极误导奖励模型而不是提供帮助。受合作沟通原则的启发,我们提出了合作而关键的奖励模型(C2),该框架通过让奖励模型与仅根据二元偏好训练的标题生成器进行批判性协作,显着改善奖励模型的判断。在 C2 中,我们通过测量每个评分标准如何将奖励模型转向或偏离正确偏好来合成有用和误导性的评分标准对。使用这些对比对,我们训练一个合作性评价标准生成器来提出有用的评价标准,并训练一个关键验证者在做出判断之前评估评价标准的有效性,仅遵循它认为在推理时有用的评价标准。 C2 优于在相同二元偏好上训练的推理奖励模型,在 RM-Bench 上获得高达 6.5 分的收益,在 AlpacaEval 2.0 上获得 6.0 分长度控制的胜率。在没有外部评分标准注释的情况下,C2 使 8B 奖励模型能够与 4$\times$ 大模型的评分标准所实现的性能相匹配。总的来说,我们的工作表明,在标题增强验证中引发刻意的合作可以使奖励模型以可扩展的方式更加值得信赖。