论文

稳定 RLHF 的不确定性奖励建模

Uncertainty-Aware Reward Modeling for Stable RLHF

模型训练奖励建模与过程监督

摘要

来自人类反馈的强化学习 (RLHF) 通过根据偏好数据训练奖励模型并优化策略以最大化预测奖励来调整 大语言模型。然而,该流程面临两个基本挑战:(1)奖励模型无法在其预测不可靠时发出信号,因为它们通常充当确定性点估计器; (2) 现代基于群体的策略优化可以放大不可靠的奖励信号,GRPO 在优势计算过程中对奖励的统一处理就是例证。随着政策探索日益多样化的应对措施,这两个限制造成了一个严重的漏洞:不可靠的奖励估计可能会产生不成比例的影响,从而引发严重的 奖励作弊。我们提出了不确定性感知奖励建模(UARM),它通过基于分位数的共形预测为奖励模型配备校准的不确定性,并通过异方差分解重新加权 GRPO 优势。 HelpSteer、UltraFeedback 和 PKU-SafeRLHF 的实验表明,与标准 GRPO 和不确定性无关的基线相比,UARM 显着改进了奖励模型校准,减少了 奖励作弊,并提高了下游对齐质量。