论文
RRC:通过基于排名的奖励构建解锁 LLM 强化学习中的生成奖励模型
RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction
摘要
奖励建模的最新进展显示了从歧视性奖励模型到生成性奖励模型的范式转变。然而,尽管生成奖励模型在响应排名方面具有强大的能力,但尚未发挥其在强化学习(RL)方面的潜力。我们的分析表明,这种限制是由于生成奖励模型的比较性质与现有强化学习算法采用的标量评分范式之间的不匹配而产生的。为了弥补这一差距,我们提出了一种基于排名的奖励构建(RRC)方法,该方法使生成奖励模型能够通过从相对偏好排名中获得奖励来提供更有效的强化学习信号。 RRC 引入了两种互补策略:自我竞争排名(利用采样响应之间的比较)和锚引导排名(利用一小组参考响应实现可扩展的基于排名的奖励构建)。开放式聊天和推理基准的实验表明,RRC 通过生成奖励模型显着改善了 RL 训练,与现有的奖励构建方法相比取得了一致的收益。我们的代码可以在 https://github.com/wangclnlp/RRC 找到。