论文
AI-T2I:聚合和隔离文本到图像合成扩散模型的交叉注意力
AI-T2I: Aggregating-and-Isolating Cross-Attention to Diffusion Models for Text-to-Image Synthesis
摘要
得益于扩散模型强大的生成能力,文本到图像的合成取得了重大进展。然而,这些模型在去噪过程中很难在交叉注意力图中实现精确的文本到图像对齐。现有的工作主要关注不同主体的主体间词元激活(即交叉注意力分数)重叠,忽略了相同主体的主体内词元激活分散问题。在本文中,我们提出了一种用于文本到图像合成的扩散模型的聚合和隔离交叉注意方法,称为 AI-T2I。从技术上讲,为了解决分散问题,我们设计了聚合损失来识别和合并分散的词元内激活,这隐式有助于减轻潜在的重叠问题。在此基础上,进一步引入隔离损失以将词元间激活分开,从而实现精确的文本到图像对齐。对各种基准的大量实验证明了 AI-T2I 相对于文本到图像合成的最先进作品的优越性。此外,我们的 AI-T2I 在其他任务中表现出出色的泛化能力,例如可控布局生成和个性化生成。我们的代码可在 https://github.com/Hatter77/AI-T2I 获取。