论文
AdvDMD:对抗性奖励与 DMD 相结合,实现高质量的少步生成
AdvDMD: Adversarial Reward Meets DMD For High-Quality Few-Step Generation
摘要
扩散模型以大量采样步骤为代价提供了卓越的生成质量。 蒸馏 方法(以分布匹配 蒸馏 (DMD) 为流行示例)可以缓解此问题,但当采样步骤有限时,性能下降仍然很明显。在 蒸馏 期间,强化学习 (RL) 已被用来提高几步生成质量,甚至有可能超越教师模型的性能。然而,现有的方法本质上是组合的,只是将 RL 过程与 蒸馏 过程集成,这引入了不必要的复杂性。为了解决这一差距,我们提出了 AdvDMD,这是一种无缝统一 DMD 蒸馏 和 RL 的方法。具体来说,AdvDMD 采用 DMD2 中经过对抗训练的判别器作为奖励模型,该模型为生成的图像分配低分,为真实图像分配高分。它接受了去噪过程的中间状态和最终状态的训练,并使用蒸馏模型在线更新,从而能够对采样轨迹进行整体监督并缓解 奖励作弊。我们采用统一的SDE后向模拟以及DMD和RL不同的训练计划,以实现更稳定、更高效的训练。实验结果表明,4 步 AdvDMD 在 DPG-Bench 上的性能优于 SD3.5 的原始 40 步模型,同时在 GenEval 上为 SD3 实现了显着的性能提升。在 Qwen-Image 上,我们的 2 步 AdvDMD 实现了优于 TwinFlow 的性能。