论文

事半功倍:我们是否需要对扩散模型的 RL 微调 进行每一步优化?

Do Less, Achieve More: Do We Need Every-Step Optimization for RL Fine-tuning of Diffusion Models?

模型训练强化学习

摘要

尽管图像生成性能很强,但扩散模型的重建目标限制了与人类偏好的一致性。强化学习通过明确的奖励来实现这种一致性。然而,大多数研究将强化学习应用于完整的去噪轨迹,这使得计算成本高昂,并削弱了偏好对齐,即做得更多,但效果却更少。我们观察到 RL 微调 的影响在不同的降噪阶段存在显着差异。在早期阶段,图像结构不稳定,与最终的奖励信号相距甚远。在这个阶段应用强化学习会导致奖励延迟和动作奖励不匹配,从而导致高方差和低效更新。相反,在后期,奖励增益饱和,持续训练往往会过度拟合局部细节,加剧奖励作弊。为了应对这些挑战,我们提出了 AdaScope,这是一种 RL 增强型插件,可以提高生成质量,同时降低计算成本。具体来说,AdaScope 通过感知去噪过程中的结构演化和语义一致性来自适应地识别 RL 的最佳干预时机,并在去噪收敛和奖励增益饱和时动态终止训练。因此,它实现了罕见的“双重好处”:计算成本降低,性能显着提高。我们为 AdaScope 的设计提供理论依据。与最先进的方法相比,AdaScope 将性能提高了 66%,同时将计算成本降低了 59%。