论文

走向普遍偏好调整:纳什均衡的扩散模型

Towards General Preference Alignment: Diffusion Models at Nash Equilibrium

模型训练偏好优化

摘要

基于人类反馈的强化学习 (RLHF) 在将文本到图像 (T2I) 扩散模型与人类偏好保持一致方面很受欢迎。作为 RLHF 的主流分支,直接偏好优化(DPO)提供了一种计算高效的替代方案,避免了显式奖励建模,并已在扩散对齐中得到广泛采用。然而,现有的基于偏好的扩散对齐方法仍然依赖于奖励引起的偏好信号,并且通常假设人类偏好可以通过 Bradley-Terry (BT) 模型充分建模,该模型可能无法捕获人类偏好的全部复杂性。在本文中,我们从博弈论的角度制定扩散对齐。我们提出扩散纳什偏好优化(Diff.-NPO),这是一种用于扩散对齐的直观通用偏好框架。 Diff.-NPO鼓励现行政策与自身对抗,以实现自我完善并导致更好的一致性。根据经验,我们通过各种指标证明了 Diff.-NPO 在文本到图像生成任务上的有效性。 Diff.-NPO 始终优于现有的基于偏好的扩散对齐方法。