论文

通过教师对齐的端到端 蒸馏 生成高保真两步图像

High-Fidelity Two-Step Image Generation via Teacher-Aligned End-to-End Distillation

摘要

少步扩散 蒸馏 对于 4-8 步生成来说已经变得越来越成熟,但进一步推进到 2 步仍然具有挑战性。在这项工作中,我们介绍了 Z-Image Turbo++,这是一种从 8 步 Z-Image Turbo 老师中提炼出来的高质量 2 步图像生成模型。我们的方法通过针对该机制量身定制的三个简单但有效的设计选择,解决了两步生成中任务难度增加和模型容量有限的核心瓶颈。首先,我们提出分布对齐对抗学习,它使用教师生成的图像而不是外部真实图像作为 GAN 训练的真实样本,提供更容易实现且信息丰富的对抗目标。其次,我们采用分步解耦参数化,为两个去噪步骤分配独立的模型参数,以更好地匹配其不同的容量需求。第三,我们通过迭代正则化执行端到端训练,允许第一步接收最终图像质量的梯度,同时通过显式的步骤 1 损失保留有意义的中间生成。总之,这些设计在定性和定量评估方面大大缩小了 2 步生成和 8 步生成之间的质量差距,凸显了精心定制的 蒸馏 策略在改善少步生成中质量效率权衡方面的潜力。