论文

学习何时去噪:优化潜在扩散的异步计划

Learning When to Denoise: Optimizing Asynchronous Schedules for Latent Diffusion

模型推理解码与生成控制

摘要

多表示扩散模型可以通过对图像的互补视图进行去噪来改进视觉合成,但其性能主要取决于确定每个表示何时进行去噪的异步时间表。我们建议学习这个时间表。我们的方法在多个表示空间上制定异步流匹配,并使用调度校正目标,该目标在调度变化时保持每个表示的局部噪声时间权重固定。我们使用灵活的参数类来实例化该调度,该参数类在构造上是凸且单调的,并使用快速联合探针来学习它,附加训练计算量少于 1%。在 ImageNet 256x256 上,学习的调度在匹配的 675M 参数 XL 主干下显着提高了收敛速度和最终质量。借助 AutoGuidance,我们的 200 epoch 模型达到了 FID 1.05,与 800 epoch SFD-XL 基线相匹配,训练量减少了 4 倍。训练到 600 epoch 进一步改进至 FID 1.02,在使用较小模型的情况下优于 FID 1.04 的 1B 参数 SFD-XXL 结果。在无引导设置中,我们的 200 epoch 模型达到 FID 2.37,已经低于 4 倍训练量下的最佳 800 epoch SFD-XL 结果 (2.54),并在 600 epoch 时提高到 FID 2.14。代码可在 https://github.com/bsq532087/LWD 获取