论文

具有奖励时刻匹配的扩散 微调 蒸馏

Diffusion Fine-tuning with Rewarded Moment Matching Distillation

摘要

蒸馏 和强化学习 (RL) 微调 是扩散 后训练 的主要支柱。虽然传统上是孤立研究的,但这些阶段之间的相互作用仍然知之甚少,特别是 微调 如何影响蒸馏模型的生成质量。我们引入奖励矩匹配 蒸馏 (RMMD),这是一种新颖的框架,可以同时提取扩散模型并最大化奖励函数。 RMMD 通过调整 同策略 训练的采样循环并将 蒸馏 损失重新用作积分 KL 正则化的代理,保留了高级 蒸馏(例如 8 步矩匹配)的高保真“自然”特性。通过评估 ImageNet 上的 FID-Reward Pareto 前沿,我们证明 RMMD 与单步基线 (DI++) 和多步竞争对手(DRaFT、HyperNoise)相比实现了卓越的权衡。最后,我们将 RMMD 应用于最先进的天气预报模型 GenCast,在优化连续排名概率得分 (CRPS) 指标的同时对其进行提炼。由此产生的蒸馏模型实现了 7.5 倍的加速,同时在 93% 的目标天气变量上优于教师模型,并且得到了更好的校准。这证明 RMMD 可以扩展到复杂、高维的科学领域。