论文

RLHF 的另一面:同策略 奖励模型自我监督改进的反馈

The Flip Side of RLHF: On-Policy Feedback for Reward Model Self-Supervised Improvement

模型训练奖励建模与过程监督

摘要

为语言模型对齐构建强大的奖励模型(RM)受到从人类注释或判断模型获取多样化且可靠的偏好数据的成本和难度的瓶颈。随着策略的发展超越静态 RM 训练,情况会变得更加糟糕。因此,我们提出了 SAVE(通过价值锚定 同策略 反馈进行自我监督奖励模型改进),这是一个通过使用 同策略 RM 训练的价值函数对 同策略 响应进行评分作为反馈的框架。 SAVE 自然地将奖励分级的 同策略 响应转换为监督,并以特定于提示的值头作为自适应锚点。它计算 RM 优势并过滤不明确的样本,以通过对比目标更新 RM。 SAVE 增强 RM 训练的有效性通过六个不同基准的严格实证评估得到了强有力的验证。它在所有数据集上都取得了优异的结果,同时在三种 RL 算法(GRPO、RLOO、GSPO)和不同的策略主干上保持了一致的改进。