论文
LGTM:无需训练 通过初始噪声处理的光引导文本到图像扩散模型
LGTM: Training-Free Light-Guided Text-to-Image Diffusion Model via Initial Noise Manipulation
摘要
扩散模型在条件文本到图像生成方面表现出了高质量的性能,特别是在边缘、布局和深度等结构线索方面。然而,照明条件受到的关注有限,并且在生成过程中仍然难以控制。现有方法通过两级管道处理照明,在生成后重新照亮图像,效率低下。此外,他们依赖于 微调 的大数据集和繁重的计算,限制了他们对新模型和任务的适应性。为了解决这个问题,我们提出了一种新颖的 无需训练 通过初始噪声操纵(LGTM)的光引导文本到图像扩散模型,它操纵扩散过程的初始潜在噪声,以通过文本提示和用户指定的光方向指导图像生成。通过对潜在空间的通道分析,我们发现选择性地操纵潜在通道可以实现细粒度的照明控制,而无需 微调 或修改预训练的模型。大量的实验表明,我们的方法在照明一致性方面超越了基于提示的基线,同时保持了图像质量和文本对齐。这种方法为动态、用户引导的灯光控制带来了新的可能性。此外,它与 ControlNet 等模型无缝集成,展示了跨不同场景的适应性。