论文
一步生成模型的漂移偏好优化
Drifting Preference Optimization for One-Step Generative Models
摘要
一步文本到图像生成器对于部署很有吸引力,因为它们通过单次前向传递生成图像,但对它们进行偏好微调仍然很困难:标准对齐方法通常依赖于 同策略 似然、去噪轨迹、可微奖励梯度或测试时优化。我们提出了漂移偏好优化(DrPO),这是一种用于确定性单步生成器的在线偏好微调方法。对于每个提示,DrPO 从当前生成器中对候选者进行采样,用目标奖励对它们进行排名,并使用高分和低分样本来合成特征空间更新方向。更新是非参数偶极子偏好场加上从冻结基础生成器估计的参考漂移,并通过分离的特征空间回归目标进行优化。目标奖励仅用于排名,因此 DrPO 可以使用大型、黑盒或不可微的奖励进行训练,而推理仍然是单个生成器调用。我们使用多个目标奖励和基准(包括 HPSv3 和 GenEval)在 SD-Turbo 和 SDXL-Turbo 上评估 DrPO。 DrPO 改进了无奖励梯度一步偏好基线的对齐,并通过删除奖励模型反向传播,在匹配的有效批次设置下将 HPSv3 训练计算减少了 $3.51\times$。初步的离线实验表明,基于样本的梯度合成也可以用于在线奖励排名之外。