论文

一致分布匹配:无需数据的扩散模型蒸馏

Consistent Distribution Matching for Data-Free Diffusion Distillation

模型优化模型推理推理加速蒸馏

摘要

由于计算量大的数值积分,流动和扩散模型的推理速度很慢。蒸馏为学生模型提供了一种有前途的方法,可以从教师的动态中学习,从而实现一步或几步生成。然而,现有的方法通常依赖于精心策划的蒸馏数据集、昂贵的教师部署或辅助代理网络,这使得模型训练和扩展变得复杂。在这项工作中,我们提出了一致分布匹配,这是一种无模拟和无数据的蒸馏方法,用于加速扩散和流动模型,同时保持强大的生成能力。我们的主要见解是将样本生成和分数估计与一个学生网络统一起来。因此,我们的框架仅使用两种模型,即冻结的教师和可训练的学生,并优化一个目标。我们证明,最小化我们的目标表明学生流图前推到教师边缘的 Wasserstein 收敛。在 ImageNet 256$\times$256 上,我们的方法在 40 个训练周期内通过单函数评估 (1-NFE) 获得了 2.04 的 FID 和 1.37 的 4-NFE FID,超过了没有数据的最先进的蒸馏基线。我们的代码和型号可在 https://consistentdmd.github.io/。 获取

一致分布匹配:无需数据的扩散模型蒸馏:论文原图
图 3:我们的一致分布匹配方法概述。面板 (a) 说明了 𝒙^t\hat{{\bm{x}}}_{t} 的有效无数据构造。请注意,ss 是学生过渡和前进路径之间的平衡时间。在(b)中,我们演示了学生代理速度如何与目标教师速度相匹配。 t、rt、r 分别是开始时间和结束时间。请注意,教师模型是唯一的监督来源。我们在附录 E 中包含了 CDMD Transformer的架构细节。