论文

Dual-FDM:以频域拆分双图参考的个性化生成

Disentangling Dual Image References in Frequency Aware Diffusion Models for Personalized Generation

模型推理解码与生成控制

摘要

个性化图像生成旨在合成以参考图像为条件的文本驱动图像,同时主要将生成视为前景的图像定制和背景的风格迁移。先前的扩散模型技术在去噪过程中存在文本与图像定制背景和风格迁移前景不一致的问题。正如我们所观察到的,这些事实源于去噪过程中混合频段之间的纠缠。为了解决这种突出的局限性,在本文中,我们研究了基于双重参考(定制以及颜色和风格参考)的个性化生成,并提出了一种在频率感知扩散模型(称为 Dual-FDM)中解开这些双图像参考的范例,通过频域内的掩模策略解开不同的频段,同时解决两个关键的个性化图像生成任务:定制风格转移和颜色风格转移。对于定制风格迁移,我们将风格参考中背景的中频段替换为定制参考中前景的中频段。对于颜色样式迁移,我们用颜色参考的前景和背景的低频频带替换样式参考中背景的低频频带。两个替换频带都用作重建去噪个性化图像的查询前景和背景的键和值。大量的实验验证了双FDM相对于最先进的扩散模型的个性化图像生成的优越性。我们的代码可以从 https://github.com/htyjers/Dual-FDM. 访问

Dual-FDM:以频域拆分双图参考的个性化生成:论文原图
图 3:我们提出的双 FDM 管道示意图 (a);对于定制风格传输(b),我们用定制参考的前景中的中频带替换风格参考中的背景中频带,称为 Dual-FDMcust(第 2.3 节)。对于颜色风格转移(c),我们用颜色参考的前景和背景的低频段替换风格参考中背景的低频段,称为 Dual-FDMcost(第 2.4 节)。两个个性化图像生成任务中的每一个都在整个去噪过程的早期和后期阶段进行,由文本提示引导,如式(1)所示。 (1).