论文
将 DPO 中的优化量表与偏好量表分开
Disentangling Optimization Scale from Preference Scale in DPO
摘要
直接偏好优化 (DPO) 是一种广泛使用的目标,用于根据偏好数据调整语言模型,系数 $β$ 通常解释为控制参考策略的 KL 约束。我们证明 $β$ 涉及两个不同的角色:它控制有效的逆偏好噪声尺度,同时重新调整优化动态,将该尺度与有效步长耦合。因此,在固定的学习率下,所实现的策略偏差在 $β$ 中是非单调的:它在较小的 $β$ 时消失在死区,在中间值达到峰值,并在较大的 $β$ 时再次下降。此外,标准 DPO 损失值在 $β$ 上不具有可比性:具有几乎相同损失曲线的运行在 KL 散度方面可能与参考模型相差数倍。这种纠缠掩盖了$β$的作用,增加了对超参数选择的敏感性,并使学习率调度变得复杂。我们提出了一个以 $β>0$ 为 argmin 等价于 DPO 的 centered-softplus 重新表述,同时使逆偏好噪声尺度和学习率效应变得明确且独立可调。归一化的 centered-softplus 目标还承认连续的 $β\to0$ 端点,可简化为线性偏好边际目标。