论文

小间隔偏好依然重要——只要训练得当

Small-Margin Preferences Still Matter-If You Train Them Right

模型训练偏好优化

摘要

DPO 等偏好优化方法使用成对比较来对齐大语言模型(LLM),但其效果可能对偏好对的质量与难度高度敏感。一种常见启发式把小间隔(含糊)对视为噪声并将其过滤掉。本文重新审视这一假设,并表明偏好对难度与优化目标强烈交互:用基于偏好的损失训练时,困难对可能破坏训练稳定并损害对齐;但用监督微调(SFT)优化时,这些对仍包含有用的监督信号。基于这一观察,我们提出 MixDPO,一个简单而有效的难度感知训练策略:(i) 将偏好数据由易到难排序(对以间隔定义的难度设置课程),(ii) 把困难对导向 SFT 目标,同时对简单对施加偏好损失。这一混合设计提供了在不引发低间隔数据上偏好损失常见优化失败的前提下利用含糊对的实用机制。在三个 LLM 评审基准上,MixDPO 持续改进对齐效果,超过 DPO 与一系列广泛使用的变体,在 AlpacaEval 2 长度控制(LC)胜率上增益尤为显著。

小间隔偏好依然重要——只要训练得当
图1:在 AlpacaEval 2 基准上随机排序与基于难度排序的性能比较。DPO 用作默认损失函数。值得注意的是,不是丢弃困难的偏好对,而是使用 SFT 损失对其进行进一步训练,可带来性能提升。