论文

奖励偏差替代:单轴偏差缓解使优化压力转向

Reward Bias Substitution: Single-Axis Bias Mitigations Redirect Optimization Pressure

模型评测鲁棒性、公平性与可信度评测

摘要

对奖励模型偏差的单轴缓解(例如降低对长度、谄媚或风格等代理变量的依赖)可能将优化压力转向相互关联的其他代理变量,而非将其消除,我们将这一失效模式称为奖励偏差替代。这一失效由度量与优化之间的鸿沟所促成,即缓解评估与策略训练期间审计分布与策略诱导分布之间的差异。我们将缓解结果形式化为一个状态分类体系,并证明:在任何基于审计分布的打分(包括排序准确率与胜率)下,即便给予对真实奖励的预言机访问,成功缓解、偏差替代与过度纠正也会产生完全相同的可观测量。在已发表的偏好学习缓解工作中,我们调研的所有方法均未报告足以证明成功缓解的证据。在评估中引入策略诱导分布并同时跟踪多个偏差,可证明地弥合这一鸿沟,我们将其转化为对缓解方法与基准的可操作建议。我们在语言模型RLHF中演示了偏差替代:GRPO训练中的长度惩罚如预期压缩了回复,却将优化压力转向置信度校准,使策略陷入过度自信,同时事实性自由作答准确率下降。我们还展示:一个已发表的长度去偏算子在审计分布上将奖励-长度相关性清零,但在四个SOTA奖励模型中的三个上经best-of-N选择后又重新引入偏差;以及一个长度-谄媚耦合在人类与LLM裁判不一致时方向发生反转。

奖励偏差替代:单轴偏差缓解使优化压力转向:论文配图
(a) 固定 γ=0.4,m=0,c=1,β=4\gamma=0.4,m=0,c=1,\beta=4 时变化 (ρ12,ρ13)(\rho_{12},\rho_{13}) 的相图。我们用第 3.3 节中的相应制度对每个网格单元进行着色。(b) 通过在固定位置改变审计分布 μdiag\mu_{\text{diag}} 均值 m1∈[−2,1]m_{1}\in[-2,1] 引起 Δ2\Delta_{2} 和 Δ​J\Delta J 的 R4 转换γ=1.0,ρ12=0.3,ρ13=0.2,c=1,β=4\gamma=1.0,\rho_{12}=0.3,\rho_{13}=0.2,c=1,\beta=4。图 3:我们将所有五个 R0–R3 实例化为单个缓解算子的可调结果,并通过仅改变审计分布的平均值来实例化 R4 μdiag\mu_{\text{diag}} 在受控设置中。图 3(a) 显示非线性项创建了新的边界结构,并且这些机制不仅仅被归纳为奖励模型属性。