论文

可视化生成扩散模型中的分布覆盖范围

Visualizing Distribution Coverage in Generative Diffusion Models

模型评测评测方法与指标

摘要

扩散蒸馏被广泛采用来加速采样,并且人们普遍认为所产生的少步模型在生成过程中可以匹配甚至超越其多步模型。然而,诸如 GenEval2 之类的标准评估通常每个提示仅抽取一个样本,因此改进的分数可能无法揭示分布覆盖范围的损失。因此,我们使用 pass@$k$ 重新审视蒸馏后的模型是否真正与老师的单次抽取性能相匹配,该模型测量 $k$ 个独立样本中至少一个满足质量标准的概率。在 $k{=}1$ 时,pass@$k$ 简化为标准单次抽取评估。随着 $k$ 的增长,该曲线揭示了额外的抽签是否发现了真正不同的成功,或者只是重新审视了相同的模式,从而直接揭示了模型覆盖有效输出空间的范围。我们首先表明,无分类器指导(CFG)是最明显的情况,其质量-覆盖权衡已得到很好的确立:较高的指导可以提高通过率@$1$,但其优势会缩小并在较大的$k$处逆转。将 pass@$k$ 应用于多步蒸馏模型,我们发现沿着训练目标存在相同的权衡分割:分布匹配目标集中了学生的输出分布,提高了早期命中率,同时侵蚀了大预算的覆盖范围,而一致性和基于轨迹的目标即使在大的 $k$ 情况下也能更好地保留教师的覆盖范围。我们进一步表明,这种权衡扩展到了几步因果视频生成。我们的研究结果揭示了之前被忽视的扩散蒸馏成本:在图像和视频生成中,训练目标的选择从根本上决定了几步模型是继承其教师的分布覆盖范围还是将其换取单次绘制质量。