论文
无需训练 一步扩散模型的图像反演
Training-free image inversion for one-step diffusion models
摘要
在这项工作中,我们引入了一种新颖的用于一步扩散模型的 无需训练 反演(TFinv)框架,解决了真实图像反演和编辑中的关键挑战。我们首先确定了阻碍真实图像反转和编辑的两个关键因素:(1)初始潜在可编辑性,它与初始噪声和理想高斯分布之间的距离有关,以及(2)文本描述间隙,这意味着文本文本描述和图像表示之间的对齐。这两个因素都会影响一步扩散模型的反演效率和可编辑性。然后,我们提出了两种新颖的技术:迭代噪声对齐(iterNA),它最小化分布间隙以与正态高斯分布对齐;后缀学习(suffL),它通过引入学习的后缀提示标记来增强文本到图像文本描述对齐。这些技术可以将输入图像精确反转为其初始噪声表示,并促进图像编辑。此外,我们提出了一种基于掩模的编辑技术,用于局部编辑,同时保留背景完整性。在 PIE-Bench 数据集上的综合实验验证了我们的方法 TFinv 不仅在一步扩散编辑中实现了最先进的性能,而且在效率上也显着优于现有的多步方法。代码可在 https://github.com/tttao-uwu/TFinv.git 获取。