论文
通过惩罚促进直接偏好优化
Boosting Direct Preference Optimization with Penalization
摘要
离线偏好优化已成为根据人类反馈进行强化学习的实用替代品,但直接偏好优化 (DPO) 及其变体等成对目标仅使用静态数据集中存储的所选和拒绝的响应。这留下了一个未使用的有用信号:参考模型本身针对相同提示生成的响应。我们提出带有惩罚的直接偏好优化(DPOP),这是 DPO 的简单扩展,通过对参考贪婪响应的门控惩罚来增强基本偏好损失。仅当当前策略仍然为首选响应分配比被拒绝响应更低的可能性时,DPOP 才会激活此惩罚。在 AlpacaEval 2.0 上,DPOP 在 Llama-3-8b-it 和 Gemma-2-9b-it 上比 DPO、SimPO 和 AlphaDPO 提高了长度控制的胜率,在两个模型上分别实现了比基线 5.3% 和 4.4% 的相对增益。消融进一步表明,在此设置中,SimNPO 式长度归一化惩罚比 NPO 和 词元级 可能性更强。