论文

GFD-OPD:跨尺度扩散模型的指导折叠on-policy蒸馏

GFD-OPD: Guidance-Folded On-Policy Distillation of Diffusion Models Across Scales

摘要

在策略蒸馏 (OPD) 展示了语言模型中的两个重要功能:将大型教师压缩为较小的学生以及将专家模型合并为单个模型。然而,现有的扩散OPD大多侧重于后者,教师和学生具有相同的骨干和规模。我们调查了从大教师到小学生的大到小扩散操作,发现标准方案失败了。为了找到根本原因,我们提出了固定状态 KL,这是一种有效且公平的方法,可以在扩散模型的 OPD 训练期间测量学生和教师之间的分配差距。我们第一个阐明了为什么从大到小的 OPD 对扩散模型具有挑战性:较小的学生很难完美匹配较大教师的分布,而无分类器指导可以累积并放大学生的条件和无条件分支与教师的条件和无条件分支之间的分布差异。为了解决这个问题,我们提出了 GFD-OPD,这是一种简单而有效的方法,可以缩小师生差距,同时避免 CFG 组合的误差放大。经过大量实验,GFD 在训练效率和最终性能方面均优于之前的基准,在所有基准测试中均取得了最先进的结果。