论文
具有耦合潜在噪声指导的环内模型自适应,用于高保真主题驱动的文本到图像生成
In-Loop Model Adaptation with Coupled Latent-Noise Guidance for High-Fidelity Subject-Driven Text-to-Image Generation
摘要
文本到图像的扩散模型在根据给定的文本提示生成高质量图像方面取得了显着的成功。主题驱动生成旨在合成定制图像,以模仿文本提示指定的不同视觉上下文中给定参考图像中主题的外观。这里的主要挑战是,当参考图像发生变化时,扩散模型无法有效地适应不同的视觉环境,同时始终保持主体身份。现有方法要么使用大型特定领域数据集来训练模型,要么在实际图像生成之前使用参考图像进行数百次迭代来微调模型。在这项工作中,我们探索了一种称为 \textit{In-Loop Model Adaptation} (IMA) 的新方法,该方法在图像生成的实际过程中的每个生成步骤中调整核心扩散模型,而无需在生成过程之前对参考图像进行训练。为此,我们建立了一个 DDIM 反转链,将参考图像映射到潜在序列,以及一个文本到图像生成链,仅根据文本提示生成图像。然后,我们引入掩码潜在一致性损失和噪声正则化损失来表征每个生成步骤中扩散模型和这两个链之间的潜在噪声差异。这种耦合的潜在噪声损失用于指导环内模型适应,以保留参考图像指定的主体身份,同时保持与文本提示的准确对齐,从而生成高保真文本到图像。我们广泛的实验表明,我们提出的 IMA 方法显着提高了主题驱动的文本到图像生成的性能。