论文
多种声音,一种奖励:LLM 评审和奖励建模的多角色评分标准生成
Many Voices, One Reward: Multi-Role Rubric Generation for LLM Judging and Reward Modeling
摘要
可靠的奖励和偏好信号对于在开放式任务上评估和优化 大语言模型 至关重要。基于评分标准的评判提供了一种透明的方式将此类判断分解为明确的评估标准,但现有的无注释评分标准生成器通常依赖于单个通用评估器。因此,他们可能会忽视人类偏好的重要维度,这是一种我们称之为维度盲点的失败模式。为了解决这个限制,我们提出了多角色评分生成(MRRG),这是一个 无需训练 和无参考框架,它从多个互补角色中得出评估标准,并将它们整合到一个可审计的基于评分的评分器中。该评分器既可用于验证成对偏好,也可用于为 GRPO 式强化学习与可验证奖励 (RLVR) 提供奖励。偏好验证基准的实验表明,MRRG 在多个骨干模型中始终优于单角色标题生成基准。进一步的 RLVR 实验表明,MRRG 为改善开放式生成产生了更强的奖励信号。