论文
实践中的模式化:用敏感性消除奖励模型的偏差
Patterning in Practice: Debiasing Reward Models with Susceptibilities
摘要
众所周知,根据人类偏好训练的奖励模型会受到长度、格式和其他风格偏差的影响。在本文中,我们使用模式化,根据每个偏好对对基准损失后验期望值(其敏感性)的测量影响重新加权,以消除在 Skywork-Reward-Preference v0.2 上训练的 Gemma 2 9B Instruct 奖励模型的偏差。我们在 RM-Bench Hard 上获得了 $+14.2 \pm 1.2$ pp,其中风格提示指向正确性(平均 $\pm$ s.e.\ 超过 5 个种子),同时保留了 RM-Bench 的整体准确度,与最接近的已发布比较器报告的最强 Hard-split 增益相当(SteerRM,$+13.2$ pp)。我们在一个简单的案例中证明,通过跟踪干预的副作用(RM-Bench 安全子集的回归)到一小类训练对,可以解释重新加权,我们通过消融来确认这一点。权重也会转移:在 Gemma 2 9B 上计算的权重消除了 Gemma 2 2B 和 27B 的偏差,无需重新计算,并部分转移到 Llama 3.1 8B。这是模式化的第一个应用,这是一个基于单一学习理论的程序,超越了小模型和综合任务。