论文

超越成对偏好:扩散模型的列表奖励感知对齐

Beyond Pairwise Preferences: Listwise Reward-Aware Alignment for Diffusion Models

模型训练偏好优化

摘要

偏好优化已成为基于人类反馈的在线强化学习 (RLHF) 的有效替代方案,用于对齐文本到图像的扩散模型。然而,现有的方法很大程度上减少了对二元成对比较的监督。当训练数据自然包含同一提示的多个候选图像,并且连续奖励分数可以提供比单个赢家-输家标签更丰富的信息时,这种成对减少是有限的。为了解决这些限制,我们提出了 Diffusion LAIR,一种用于扩散模型的奖励感知列表偏好优化方法。对于每个提示,LAIR 将一组候选图像的奖励分数转换为中心优势权重,然后优化隐式奖励的优势加权回归目标,定义为当前模型相对于固定参考模型的去噪损失改进,并使用二次惩罚来规范隐式奖励的大小。由此产生的目标同时使用所有候选者而不是选择对,并且通过明确控制隐性奖励的大小来保持保守。 LAIR 目标承认隐式奖励空间中存在有界封闭形式最优,阐明了正则化强度如何控制偏好更新的幅度。实验表明,Diffusion LAIR 在文本到图像生成、合成生成和图像编辑基准方面优于 SD1.5 和 SDXL 上的强偏好优化基准。