论文
PEBS:RLHF 奖励模型校准的按评估者经验贝叶斯收缩
PEBS: Per-rater Empirical-Bayes Shrinkage for RLHF Reward-Model Calibration
摘要
人类反馈强化学习 (RLHF) 的奖励模型汇集了数千个注释者的偏好,并适合一个全局仿射校准器,将具有系统不同的评级量表偏移和斜率的评级者折叠为与任何单个注释者都不匹配的单个平均评级者拟合。 PEBS 是每个评估者的经验贝叶斯收缩估计器:它在每个注释者评级的保留切片上拟合每个评估者的仿射校准器,并将 Morris-James-Stein 经验贝叶斯收缩应用于总体平均值,以封闭形式且无需重新训练奖励模型。在 PRISM 上,PEBS 使用户内部保留的 RMSE 比汇总人口斜率基线降低了 8.58%。该程序在 PluriHarms 伤害评级(Qwen-2.5 基础,家庭内)上进行复制,与相同的人口斜率基线相比,RMSE 降低了 +9.66%。 PEBS 是一种封闭式事后估计器,用于 RLHF 奖励建模中特定于注释器的仿射校准;它保持奖励基础模型不变,并仅估计在新评级的推理时使用的评级者级别图。