论文
RUBRIC-ARROW:不可验证域中 LLM 后训练 的交替点式 Rubric 奖励建模
RUBRIC-ARROW: Alternating Pointwise Rubric Reward Modeling for LLM Post-training in Non-verifiable Domains
摘要
逐点奖励模型为 LLM 后训练 提供了关键信号,但在主观、不可验证的设置中难以实现绝对评分。基于Rubric的方法通过将评估分解为明确的标准来解决这个问题,但现有的方法通常依赖于前沿LLM,并且受到硬布尔聚合引起的联系的影响。我们提出了 RUBRIC-ARROW,这是一个交替框架,联合训练一个 rubric 生成器和一个 rubric 条件判断器,其 RL 阶段仅使用成对偏好数据。我们的方法结合了基于概率的评分规则(减少与特定阶段的基于偏好的奖励的联系)和交替的 GRPO 方案,共同训练逐点评估器。大量实验表明,RUBRIC-ARROW 实现了有竞争力的奖励建模准确性,并为下游策略 后训练 带来了一致的收益。