论文
ViPO:大规模视觉偏好优化
ViPO: Visual Preference Optimization at Scale
摘要
虽然偏好优化对于改进视觉生成模型至关重要,但如何有效地扩展这种范式在很大程度上仍未得到探索。当前的开源偏好数据集包含相互冲突的偏好模式,其中获胜者在某些方面表现出色,但在其他方面表现不佳。对此类嘈杂的数据集进行天真的优化无法学习偏好,从而阻碍了有效的扩展。为了增强抗噪声的鲁棒性,我们提出了 Poly-DPO,它通过一个额外的多项式项扩展了 DPO 目标,该多项式项根据数据集特征动态调整模型置信度,从而实现跨不同数据分布的有效学习。除了有偏差的模式之外,现有数据集还存在分辨率低、提示多样性有限和分布不平衡的问题。为了通过解决数据瓶颈来促进大规模视觉偏好优化,我们构建了 ViPO,这是一个大规模偏好数据集,其中包含跨五个类别的 100 万个 1024 像素图像对和跨三个类别的 30 万个 720p+ 视频对。最先进的生成模型和多样化的提示确保了可靠的偏好信号和平衡的分布。值得注意的是,当将 Poly-DPO 应用于我们的高质量数据集时,最佳配置收敛于标准 DPO。这种收敛验证了数据集质量和 Poly-DPO 的自适应性质:在数据质量足够的情况下,复杂的优化变得不必要,但对于不完美的数据集仍然有价值。我们在视觉生成模型中验证了我们的方法。在像 Pick-a-Pic V2 这样的噪声数据集上,Poly-DPO 在 SD1.5 和 SDXL 的 GenEval 上分别比 Diffusion-DPO 获得了 6.87 和 2.32 的增益。对于 ViPO 来说,模型的性能远远超过了在现有开源偏好数据集上训练的模型。这些结果证实,解决算法适应性和数据质量对于扩展视觉偏好优化至关重要。