论文
DPO 与 RLHF 的条件等价性:隐含假设、失效模式与可证明对齐
Conditional Equivalence of DPO and RLHF: Implicit Assumption, Failure Modes, and Provable Alignment
摘要
直接偏好优化(DPO)已成为人类反馈强化学习(RLHF)的一种流行替代方案,在理论上与之等价且实现更简单。我们证明这种等价性是有条件的而非普遍的,它依赖于一个在实践中经常被违反的隐含假设:RLHF 最优策略必须偏好人类所偏好的回复。当该假设不成立时,DPO 优化的是相对参考策略的相对优势,而非与人类偏好的绝对对齐,导致病态收敛:策略在降低 DPO 损失的同时却偏好不被人类青睐的回复。我们刻画了该假设何时被违反,证明了一个不合意解空间的存在,并证明在这种情况下 DPO 与 RLHF 优化的是根本不同的目标。为解决这一问题,我们提出约束偏好优化(CPO),通过为 RLHF 增加约束来实现可证明的对齐。我们进一步通过软间隔排序给出几何解释,揭示 DPO 实现的是目标值可能为负的间隔排序。我们的理论分析明确了 DPO 的保证何时成立,并提供了兼具简洁性与可证明对齐的解决方案。在标准基准上的全面实验表明,CPO 取得了最先进的性能。代码发布于:https://github.com/visitworld123/CPO。
