论文

彩色噪声:无需训练 低频噪声处理,用于基于颜色的条件图像生成

Colorful-Noise: Training-Free Low-Frequency Noise Manipulation for Color-Based Conditional Image Generation

模型推理解码与生成控制

摘要

文本到图像扩散模型通过逐渐将高斯白噪声转换为自然图像来生成图像。由于缺乏结构,高斯白噪声非常适合从单个文本提示生成不同的输出。然而,这种特性限制了对特定视觉属性的控制和可预测性,因为噪声是人类无法解释的。在这项工作中,我们研究了扩散模型中输入噪声的特征。我们表明,尽管高斯白噪声中的所有频率都具有可比较的统计能量,但低频分量主要决定图像的全局结构和颜色组成,而高频分量控制更精细的细节。基于这一观察,我们证明使用低频图像先验对低频噪声进行简单操作可以有效地调节生成过程以重建这些低频视觉线索。这使我们能够以最小的开销定义一个简单的 无需训练 方法,该方法可以控制整体图像结构和颜色,同时让高频分量自由地以精细细节的形式出现,从而实现生成的输出的可变性。