论文
具有扩散奖励的 Diff-Instruct:迈向有原则的一步生成器 RL
Diff-Instruct with Diffused Reward: Towards Principled One-step Generator RL
摘要
一步式文本到图像生成的最新进展使得实时合成成为可能,并且具有显着的效率和质量。先前的一步生成器的强化学习方法将图像空间奖励优化与扩散噪声空间分布匹配相结合。由于终端奖励优化和潜在的生成动力学之间的不匹配,这种范式带来了挑战。因此,优化倾向于利用随机自由度,通常以牺牲图像保真度为代价来提高奖励。为了解决这个问题,我们提出了 Diff-Instruct with Diffused Reward (DIDR),这是一种源自 Integral KL 最小化的无数据轨迹级对齐框架。 DIDR 沿着扩散轨迹在所有噪声级别上传播 RLHF 最优奖励倾斜的干净图像分布。我们表明,该目标允许与干净图像 RLHF 相同的最小化器,同时自然地引入扩散奖励分数(DRS),它充当对参考分数函数的奖励驱动校正。为了使其实用,我们进一步引入了扩散奖励代理(DRP),这是一种基于可微分短步去噪的 DRS 有效估计器。大量实验表明,DIDR 始终帕累托主导现有的单步 SDXL 基线。此外,当转移到 6B DiT 主干(Z-Image)时,DIDR 在偏好对齐方面超越了其 50 步教师,同时只需要一个生成步骤。