论文

文本到图像扩散模型的双重反演:从即时和噪声的角度来看

Dual Inversion for Text-to-Image Diffusion Models: From Both Prompt and Noise Perspectives

模型推理解码与生成控制

摘要

即时反演作为一种典型的逆向工程技术,使文本到图像(T2I)扩散模型能够生成所需的目标图像,而无需进行大量的即时工程。然而,现有的即时反演方法存在很大的局限性:(1)基于梯度的方法不稳定且无法解释,通常会导致生成的图像具有严重的伪影; (2)无梯度方法产生人类可读的提示,但由于缺乏细粒度的细节对齐,仍然无法保持视觉保真度。我们认为,这些局限性源于将即时反演视为逆向工程的充分条件,而忽略了编码结构信息的潜在噪声的关键作用。因此,我们提出了 Dualin(双反演),这是一种两阶段方法,可以联合恢复目标图像的语义提示和潜在噪声。在第一阶段,我们集成视觉语言模型、CLIP和大语言模型来反转忠实的、人类可解释的硬提示。第二阶段,无条件DDIM反演重建目标图像的精确潜在噪声,保证结构信息层面的一致性。从理论上讲,我们证明反转噪声可以实现灵活的图像编辑而无需重新优化。对不同数据集的大量实验表明,Dualin 同时生成高质量的倒置提示并实现了最先进的图像保真度。此外,Dualin还可以为精确可控的图像编辑奠定坚实的基础。