论文
改进的分布扩散模型
Improved Distributional Diffusion Models
摘要
分布扩散模型 (DDM) 将标准均值预测降噪器替换为通过评分规则目标训练的 分布 降噪器,学习 $p(x_1 \mid x_t)$ 的随机近似值,而不是其条件均值。然而,将 DDM 扩展到现代图像生成设置面临两个障碍:(i) 多粒子训练会产生随粒子数量扩展的开销,(ii) DDM 使用全局固定评分规则超参数,迫使在采样预算之间进行单一权衡。我们通过将粒子扩展推迟到后期Transformer层来减轻这些限制,并通过引入由~\citet{Biroli2024}的动态机制通知的时间相关评分规则时间表来进行超参数权衡。与基于 DiT 的潜在设置相结合,这些变化使得 DDM 训练在类条件 ImageNet-$256^2$ 上变得实用,通过 DiT-XL/2 在 4 个步骤中实现 4.48 FID,在 50 个步骤中实现 2.38,在一个阶段从头开始训练单个模型,无需教师、自我蒸馏或 JVP。结果是一个随机的少步生成器,其 FID 不会随着采样预算从 4 NFE 增长到 50 NFE 而降低,并且相同的配方转移到文本到图像生成。 https://github.com/CompVis/iDDM. 提供代码和预训练模型