论文

使用基于梯度的强化学习引导分布匹配 蒸馏

Guiding Distribution Matching Distillation with Gradient-Based Reinforcement Learning

摘要

扩散 蒸馏(以分布匹配 蒸馏 (DMD) 为例)在几步生成中显示出巨大的前景,但通常会为了采样速度而牺牲质量。虽然将强化学习 (RL) 集成到 蒸馏 中具有潜力,但这两个目标的简单融合依赖于次优的原始样本评估。这种基于样本的评分与 蒸馏 轨迹产生了固有的冲突,并且由于早期生成的噪声性质而产生不可靠的奖励。为了克服这些限制,我们提出了 GDMD,这是一种新颖的框架,它通过优先考虑 蒸馏 梯度而不是原始像素输出作为优化的主要信号来重新定义奖励机制。通过将 DMD 梯度重新解释为隐式目标张量,我们的框架使现有奖励模型能够直接评估 蒸馏 更新的质量。这种梯度级指导充当自适应权重,将 RL 策略与 蒸馏 目标同步,有效地消除优化分歧。实证结果表明,GDMD 为少步生成设置了新的 SOTA。具体来说,我们的 4 步模型的性能优于多步教师的质量,并且在 GenEval 和人类偏好指标方面大大超过了之前的 DMDR 结果,展现出强大的可扩展潜力。