论文

$R_\text{dm}$:重新概念化分布匹配作为扩散的奖励 蒸馏

$R_\text{dm}$: Re-conceptualizing Distribution Matching as a Reward for Diffusion Distillation

摘要

扩散模型实现了最先进的生成性能,但从根本上受到其缓慢的迭代采样过程的瓶颈。虽然扩散 蒸馏 技术可以实现高保真、少步骤的生成,但传统目标通常通过将学生的表现完全依赖于教师来限制学生的表现。最近的方法试图通过集成强化学习(RL)来打破这个上限,通常是通过 蒸馏 和 RL 目标的简单求和。在这项工作中,我们通过重新概念化分布匹配作为奖励,提出了一种新颖的范例,表示为 $R_\text{dm}$。这种统一的视角弥合了扩散匹配 蒸馏 (DMD) 和 RL 之间的算法差距,提供了几个主要好处。 (1) 增强优化稳定性:我们引入了组归一化分布匹配(GNDM),它采用标准 RL 组归一化来稳定 $R_\text{dm}$ 估计。通过利用组均值统计,GNDM 建立了更稳健、更有效的优化方向。 (2) 无缝奖励集成:我们以奖励为中心的公式本质上支持自适应权重机制,允许 DMD 与外部奖励模型的流畅组合。 (3) 提高采样效率:通过与强化学习原则保持一致,该框架很容易融入重要性采样(IS),从而显着提高采样效率。大量实验表明 GNDM 优于普通 DMD,将 FID 降低了 1.87。此外,我们的多奖励变体 GNDMR 通过在美学质量和保真度之间实现最佳平衡,超越了现有基线,实现了 30.37 的峰值 HPS 和 12.21 的低 FID-SD。最终,$R_\text{dm}$ 为实时、高保真合成提供了一个灵活、稳定、高效的框架。代码即将推出。