论文
奖励偏差替代:单轴偏差缓解使优化压力转向
Reward Bias Substitution: Single-Axis Bias Mitigations Redirect Optimization Pressure
摘要
对奖励模型偏差的单轴缓解(例如降低对长度、谄媚或风格等代理变量的依赖)可能将优化压力转向相互关联的其他代理变量,而非将其消除,我们将这一失效模式称为奖励偏差替代。这一失效由度量与优化之间的鸿沟所促成,即缓解评估与策略训练期间审计分布与策略诱导分布之间的差异。我们将缓解结果形式化为一个状态分类体系,并证明:在任何基于审计分布的打分(包括排序准确率与胜率)下,即便给予对真实奖励的预言机访问,成功缓解、偏差替代与过度纠正也会产生完全相同的可观测量。在已发表的偏好学习缓解工作中,我们调研的所有方法均未报告足以证明成功缓解的证据。在评估中引入策略诱导分布并同时跟踪多个偏差,可证明地弥合这一鸿沟,我们将其转化为对缓解方法与基准的可操作建议。我们在语言模型RLHF中演示了偏差替代:GRPO训练中的长度惩罚如预期压缩了回复,却将优化压力转向置信度校准,使策略陷入过度自信,同时事实性自由作答准确率下降。我们还展示:一个已发表的长度去偏算子在审计分布上将奖励-长度相关性清零,但在四个SOTA奖励模型中的三个上经best-of-N选择后又重新引入偏差;以及一个长度-谄媚耦合在人类与LLM裁判不一致时方向发生反转。
