论文

CDRRM:对比驱动的量规生成,实现可靠且可解释的奖励建模

CDRRM: Contrast-Driven Rubric Generation for Reliable and Interpretable Reward Modeling

模型训练奖励建模与过程监督

摘要

奖励建模对大语言模型(LLM)与人类偏好对齐至关重要,但传统奖励模型可解释性差,且严重依赖昂贵的专家标注。尽管近年基于量规(rubric)的方法提升了评估透明度,但其缺乏系统性质量控制,产生噪声与冗余标准,未能缓解LLM评估者中顽固的偏差(如冗长、位置),并造成可扩展性与可靠性的权衡。为解决这些局限,我们提出CDRRM(对比驱动量规奖励模型),一个建立在"先对比后综合"新范式之上、用于高质量量规生成与引导式偏好判断的框架。CDRRM先对偏好对做多维对比画像以识别因果性判别因素,再将这些洞见合成为紧凑、情境感知的量规以引导偏好判断。在三个权威基准(RewardBench、RMBench、RMB)上的大量实验表明,CDRRM在多样领域取得最先进性能,并有效缓解了上述评估偏差。值得注意的是,我们的方法数据效率出色:仅用3千个高质量样本训练量规生成器,即可让冻结的预训练判别模型超越全量微调基线。本工作为奖励建模提供了一条可扩展、可解释且数据高效的路径。

CDRRM:对比驱动的量规生成,实现可靠且可解释的奖励建模:论文配图
图 1. 最大公约数 (GCD) 任务的标题生成的说明性示例,将直接提示的标题(右侧、冗余且可能具有误导性)与我们的“对比然后综合”范式(左侧、简洁且有效)的标题进行对比。左下面板显示了针对单一偏好生成的评分标准数量的统计数据。可访问性的简短描述。