论文

纠正然后扩散:在去噪轨迹展开之前理清概念

Rectify Then Diffuse: Disentangling Concepts Before Denoising Trajectory Unfolds

模型推理解码与生成控制

摘要

文本到图像的扩散模型可以很好地生成单独的概念,但它们经常会忽略或错误地将多个概念与多个概念合并。我们将这些失败追溯到早期的协调瓶颈:在去噪开始之前,即时条件注意力可能会将不同的概念分配给强烈重叠的空间支持,这可以在去噪进行时保持注意力耦合。这一观察促使将成分生成视为边界条件问题,而不是重复控制演化轨迹。为此,我们提出了 Rectify-then-Diffuse (RTD),这是一个 无需训练 框架,它在标准去噪之前对初始分配进行一次纠正。首先,我们提出了软重叠解缠(SOD),它将飞行员概念图之间的归一化重叠转换为可微且与布局无关的分离目标。其次,我们引入了各向同性梯度校正(IGR),它对 SOD 梯度进行归一化,并在提示和初始化中应用具有一致尺度的有界潜在位移。大量实验表明,RTD 实现了最先进的构图保真度和稳健的增益。在 AE-Bench 对象对子集中,RTD 比 CO3 将 BLIP-VQA 提高了 45.8%,将 ImageReward 提高了 19.6%,同时运行速度提高了 2.3$\times$。代码将发布在https://github.com/Z-yiwei/rectify-then-diffuse