论文

学习图像和布局先验之间的交互,以在设计模板中生成联合图像布局

Learning Interaction between Image and Layout Priors for Joint Image-Layout Generation in Design Templates

模型架构新型架构

摘要

在本文中,我们解决了图形设计模板创建的问题,该模板生成背景图像和前景元素在背景上的布局,以根据输入文本形成和谐的构图。先前关于图形设计生成的工作大多采用顺序范式,其中设计元素是按顺序生成的。我们认为,这种顺序方案无法忠实地捕获背景和布局(以及联合图像布局分布)之间的依赖性,这限制了生成的设计模板的质量。为了克服这一限制,我们提出了一个模型 InterIL,它在单个生成过程中联合生成两种模式:背景图像和布局。我们的联合模型的新颖设计将预训练图像和布局扩散模型的主干与可学习的通信模块连接起来,以显式地建模双向图像布局交互。在训练过程中,图像和布局主干被冻结,以维护和利用大量预训练的单模态先验知识,而仅更新通信模块,以便模型可以专注于学习图像布局交互,从而更好地捕获联合图像布局分布,以改善构图和谐。我们的模型没有特定于设计的归纳偏差,这使得它能够更好地保留现实设计的原始特征。我们进一步引入了测试时指导策略,使用户能够将自己的特定偏好强加于生成的结果。我们的实验表明,与之前的方法相比,我们的模型可以在图像、布局和图像布局协调方面产生明显更好的结果,产生更接近真实样本的输出。我们还展示了我们的模型在推理时强制执行用户偏好而无需重新训练的灵活性。