论文

直接偏好优化的不确定性标准化裕度

Uncertainty-Normalized Margins for Direct Preference Optimization

模型训练偏好优化

摘要

直接偏好优化 (DPO) 通过具有通用噪声尺度的 Bradley-Terry 模型对二元偏好进行建模,无需明确考虑偏好强度或来自人类反馈的与提示相关的不确定性。我们引入了不确定性归一化边际 DPO (UNM-DPO),它将强度相关边际与学习的提示量表结合起来。在异方差 Bradley-Terry 模型的推动下,我们制定了两个训练目标。两者都比较首选和拒绝响应的隐式奖励,这些奖励是从响应对数概率比与参考策略得出的。仅优势(AO)在减去利润之前将此奖励差异除以提示规模;整体残差 (WR) 在除以比例之前减去余量。对于WR比较模型,我们建立了一个充要条件,在该条件下已知的裕度使得即时尺度可识别。我们介绍学习音阶的实用程序。在 WR 的基础上,我们引入了 ULNM-DPO-WR,它通过长度标准化每个响应的隐式奖励。我们使用 Skywork 奖励模型作为评判,根据 DPO 以及 HelpSteer2 和 HelpSteer3 上的相关基线评估我们的方法。借助 Llama-3.1-8B-Instruct,ULNM-DPO-WR 在评估小组中相对于匹配的 DPO 实现了 68.00% 和 65.31% 的平局调整胜率,平均奖励更高,平均响应更短。在使用 GPT-4.1 判断和 GPT-4-Turbo 参考答案的 AlpacaEval 上,相同的 8B 策略实现了 21.62% 的长度控制胜率,而 DPO 为 16.39%,SimPO 为 15.30%。这些结果证明了将偏好强度边际、学习提示尺度和长度标准化结合起来进行策略优化的潜力。