论文
高CFG扩散反演何时失败?即时-潜在互动的对照研究
When Does High-CFG Diffusion Inversion Fail? A Controlled Study of Prompt--Latent Interactions
摘要
文本引导的扩散反演是图像编辑的核心,其中图像被映射到初始潜在图像,然后通过在修改的提示下重播去噪过程来进行编辑。然而,在实践中,反演通常使用比用于生成或编辑的尺度更低的无分类器引导 (CFG) 尺度来执行。这种不匹配在经验上是有用的,但留下了一个未解决的基本问题:当目标图像由高 CFG 轨迹生成时,该轨迹何时可以真正反转?我们在受控生成-反转-重建设置中研究这个问题,其中真实的初始潜在轨迹和去噪轨迹是已知的。使用来自现有扩散编辑基准的提示,我们在高 CFG 下生成图像,并使用相同的提示和指导设置通过定点反演重建它们。结果揭示了三种类型的提示级重建行为:针对大多数初始潜在变量进行重建的简单提示,对于大多数初始潜在变量而言失败的硬提示,以及其成功取决于提示-潜在变量配对的中间提示。为了分析生成方面,我们定义了即时压力,这是一种逐步测量 CFG 将去噪更新远离无条件轨迹的强度的方法。总压力与重建质量相关,并将简单提示与困难提示区分开来,但它不能解释中间提示(潜在对)的成功或失败。文本方面的分析进一步表明,主要视觉主题和措辞可以改变反转难度。最后,我们评估了一种紧凑的轨迹一致性干预,该干预仅在局部不稳定的逆步骤上放松指导。这种诊断检查改进了我们受控设置中的重建和提示到提示编辑,支持了高 CFG 反转失败需要本地轨迹感知分析的观点。