论文
Linear-DPO:扩散和流匹配生成模型的线性直接偏好优化
Linear-DPO: Linear Direct Preference Optimization for Diffusion and Flow-Matching Generative Models
摘要
直接偏好优化(DPO)在 LLM 中的对齐方面取得了成功,但在文本到图像生成方面仍然面临挑战。现有的研究仅限于去噪扩散模型,而忽略了流匹配,并且在将基于 NLP 的离散 DPO 应用于基于回归的生成任务时,会遇到目标不匹配的问题。\在本文中,我们通过统一的逆时 SDE 框架推导了一个涵盖扩散和流匹配的广义 DPO 目标,并从梯度角度指出标准 DPO 目标对于文本到图像的生成来说不是最优的。因此,我们提出了 Linear-DPO,它用持续的线性效用取代了激进的基于 sigmoid 的效用函数,并结合了 EMA 更新的参考模型。扩散模型(SD1.5、SDXL)和流匹配模型(SD3-Medium)的定性和定量实验证明了我们的方法相对于现有基线的优越性。