论文
梯度门控 DPO:稳定语言模型中的偏好优化
Gradient-Gated DPO: Stabilizing Preference Optimization in Language Models
摘要
直接偏好优化 (DPO) 通过增加选择的响应和拒绝的响应之间的裕度来提高相对偏好,但该目标并未指定应如何重新分配概率质量以实现该裕度。因此,即使概率质量从首选和不相关的响应中崩溃,偏好分离也可以得到改善,这是一种与挤压效应相关的现象。我们证明了这种病态是局部的:当被拒绝的响应进入低概率谷时,持续的负更新变得具有破坏性,其中进一步的抑制会通过耦合的 softmax 几何形状导致有害的重新分配。我们引入了梯度门控偏好优化(Gate-DPO),它使用每个被拒绝响应的当前概率几何来选择性地减弱其贡献,限制过度的拒绝抑制,同时延迟偏好损失饱和。 Gate-DPO 与目标无关,并与现有的偏好方法组合。在四种架构、两个偏好数据集和多个目标中,门控一致地减少了挤压并提高了选择响应的可能性,同时表现出跨架构和目标的拒绝响应崩溃的强劲减少。质量动力学分析进一步表明,大的偏好边际可以掩盖对不相关反应的实质性抑制,而门控则实现更健康的再分配。总之,我们的结果表明,仅偏好边际不足以表征优化的健康状况,并且有选择地控制概率动态为稳定偏好优化提供了一种简单、通用的机制。