论文

当分配收益失败时:评估偏好转变下从弱到强的奖励模型

When In-Distribution Gains Fail: Evaluating Weak-to-Strong Reward Models under Preference Shift

模型训练奖励建模与过程监督

摘要

弱到强(W2S)泛化是一个有前途的可扩展监督框架,但现有的评估经常在匹配的训练测试分布下测试学生。因此,我们研究了零样本分布转移下的 W2S 偏好学习,发现在弱偏好标签上训练的强学生可以在分布中表现出成功,但无法跨偏好数据集转移。我们提供了表征故障模式的证据,其中弱监督 微调 可以将强模型拉向源域特征,而不是维持广泛可转移的偏好表征。为了缓解这个问题,我们提出了表示锚定(Anchor),这是一种简单而有效的正则化器,可以在 微调 期间限制预训练强模型表示空间的过度漂移,同时仍然允许任务相关的适应。在偏好域、数据集和模型系列中,Anchor 持续改进分布外传输,同时保持具有竞争力的分布内性能。我们的评估协议、转移感知指标和方法共同暴露了当前 W2S 奖励模型中隐藏的脆弱性,并为实现更稳健的偏好转移提供了一条实用途径。