AdaDPO:具有平衡梯度更新的自适应直接偏好优化
AdaDPO: Self-Adaptive Direct Preference Optimization with Balanced Gradient Updates
摘要
DPO 已成为 RLHF 的广泛采用的替代方案,用于使 LLM 与人类偏好保持一致,从而无需单独的奖励模型或 RL 循环。最近的理论分析揭示了 DPO 中的不对称梯度行为:损失抑制不良反应的速度远远快于促进首选反应的速度,导致模型学会避免错误的答案,而不是生成好的答案。我们提出了 AdaDPO,这是 DPO 算法的自适应变体,它引入了直接从策略模型的生成概率导出的每个偏好对、基于停止梯度的系数,并将参考模型的概率作为可选组件。 AdaDPO 的构建是为了强制首选概率和非首选概率之间的梯度大小相等;实际实现会平衡每个词元的梯度,并应用数值裁剪界限来保持稳定性,同时保留 DPO 的原始超参数结构。在 SimPO 类似设置下在 UltraFeedback 上训练的 Llama-3-8B-Instruct 上,AdaDPO 在 AlpacaEval 2 上始终优于 DPO:它在 81% 的超参数组合中实现了更高的长度控制胜率 (LC),获得了全局最佳 LC (48.3%) 和原始胜率 (46.1%),并在 88% 的组合中扩大了 LC-over-WR 裕度,表明有效缓解了长度偏差。对 KL 散度、奖励裕度和奖励准确性的额外分析证实,AdaDPO 纠正了梯度不平衡并产生更有效的优化。由于 AdaDPO 纯粹在损失级别运行,因此可以将其放入现有的基于偏好的对齐管道中,而无需更改数据收集或模型架构。该方法只需要几行代码,相同的自适应原理可以推广到一系列成对对比偏好损失,包括 SimPO、R-DPO、IPO、CPO 和 ORPO。