论文
AsyncPatch Diffusion:空间灵活的图像生成
AsyncPatch Diffusion: spatially-flexible image generation
摘要
标准扩散模型用单个共享噪声水平破坏整个样本,迫使所有空间区域遵循相同的去噪轨迹。我们引入了 AsyncPatch Diffusion,这是一种联合扩散框架,它将不同的噪声级别分配给不同的输入维度,例如图像像素或潜在标记。我们展示了这种异步损坏如何定义有效的生成过程,同时支持更丰富的空间异构去噪轨迹系列,并证明该过程的第一个有效的 ELBO。我们表明,单个预训练模型可以执行空间自适应生成,其中不同区域按不同的时间表进行去噪。一个关键的挑战是训练:简单的独立噪声水平采样过分强调高度异构的配置,而低估了均匀的噪声水平,而这在采样过程中至关重要。我们通过受控噪声水平采样器来解决这个问题,该采样器可以调节平均损坏水平及其空间变异性。 AsyncPatch 在 ImageNet 256 和 LSUN 上实现了与传统扩散相当的生成质量,同时本身就适合修复,无需特定于任务的 微调。我们进一步引入输入指导,它使用干净或部分损坏的区域来指导未知区域的生成,从而提高局部一致性和纹理匹配。最后,我们演示了自适应生成策略,包括不确定性引导加速和自回归采样。