论文

当偏好标签失效时:根据真实数据调整扩散模型

When Preference Labels Fall Short: Aligning Diffusion Models from Real Data

模型训练偏好优化

摘要

偏好对齐旨在通过从偏好和非偏好样本之间的比较中学习来指导生成模型。在实践中,大多数现有方法依赖于从模型生成的图像构建的偏好对。这种监督本质上是相对的,并且当两个样本都表现出伪影或有限的视觉质量时可能会含糊不清,从而很难推断出什么构成了真正理想的输出。在这项工作中,我们研究真实数据是否可以作为偏好调整的替代监督来源。我们采用以数据为中心的视角,并研究了一种管理策略,该策略将真实图像视为参考点,并通过将它们与生成或扰动的样本进行对比来构造偏好信号,而不需要手动注释的偏好对。通过实证分析,我们表明基于真实数据的监督为调整扩散模型提供了有效的指导,并实现了与现有基于偏好的方法相当的性能。我们的结果表明,真实数据为偏好对齐提供了实用且补充的监督来源,并突出了标签高效对齐策略的方向。代码和模型可在 https://cwyxx.github.io/RealAlign 获取。