论文

竞技场作为离线奖励:扩散模型的高效细粒度偏好优化

Arena as Offline Reward: Efficient Fine-Grained Preference Optimization for Diffusion Models

模型训练偏好优化

摘要

来自人类反馈的强化学习(RLHF)有效地促进了文本到图像(T2I)扩散模型的偏好对齐。为了提高计算效率,避免显式奖励建模的直接偏好优化(DPO)已被广泛研究。然而,它对二进制反馈的依赖限制了它对所选拒绝对的粗粒度建模,从而导致优化不理想。在本文中,我们提出了ArenaPO,它利用Arena分数作为线下奖励来提供精细化反馈,从而在没有奖励模型的情况下实现高效、细粒度的优化。这使得ArenaPO既能受益于传统RLHF的丰富奖励,又能受益于DPO的高效。具体来说,我们首先构建一个模型 Arena,其中每个模型的能力表示为高斯分布,并通过遍历带注释的成对偏好来推断这些能力。每个输出图像被视为相应能力分布的样本。然后,对于图像对,以两个能力分布和观察到的成对偏好为条件,使用基于截断正态分布的潜变量推断来估计绝对质量差距,这在训练期间充当细粒度反馈。它不需要奖励模型,并且可以离线计算,因此不会引入额外的训练开销。我们在 Pick-a-Pic v2 和 HPD v3 数据集上进行 ArenaPO 训练,结果表明 ArenaPO 始终优于现有基线。