论文

具有锚定指导的方差感知奖励建模

Variance-aware Reward Modeling with Anchor Guidance

模型训练奖励建模与过程监督

摘要

当人类偏好多元化时,标准 Bradley-Terry (BT) 奖励模型会受到限制。尽管软偏好标签保留了分歧信息,但 BT 只能通过缩小奖励幅度来表达它。高斯奖励模型通过联合预测奖励均值和奖励方差提供了一种替代方案,但仅因成对偏好而存在基本的不可识别性。我们提出了锚引导方差感知奖励建模,该框架通过使用两个粗略响应级别锚标签来增强偏好数据来解决这种不可识别性。在此基础上,我们证明两个锚足以进行识别,制定联合训练目标,并为估计的奖励均值和方差函数建立非渐近收敛率。通过模拟研究和四个现实世界的不同偏好数据集,我们的方法持续改进奖励建模性能和下游 RLHF,包括 PPO 训练和 best-of-$N$ 选择。