论文
去噪,快速和慢速:用于图像生成的困难感知自适应采样
Denoising, Fast and Slow: Difficulty-Aware Adaptive Sampling for Image Generation
摘要
基于扩散和流的模型通常跨空间统一分配计算,以相同的时间步长和函数评估数量更新所有补丁。虽然很方便,但这忽略了自然图像的异质性:一些区域很容易去噪,而另一些区域则受益于更多的细化或额外的上下文。受此启发,我们探索了用于图像合成的补丁级噪声尺度。我们发现,在图像标记之间天真地改变时间步的效果很差,因为它使模型暴露在推理时不会发生的信息过多的训练状态中。因此,我们引入了一个时间步采样器,它明确控制训练期间可用的最大补丁级信息,并表明从全局时间步到补丁级时间步已经改进了标准基线上的图像生成。通过使用轻量级的每补丁难度头进一步增强模型,我们启用了自适应采样器,可以在最需要的地方动态分配计算。结合随空间和扩散时间变化的噪声水平,这就产生了补丁强制(PF),这是一个可以更早推进较容易区域的框架,以便它们可以为较困难的区域提供背景。 PF 在类条件 ImageNet 上取得了优异的结果,与表示对齐和引导方法保持正交,并扩展到文本到图像的合成。我们的结果表明,补丁级去噪方案为自适应图像生成提供了有希望的基础。