论文
通过构图迁移促进审美图像的生成
Advancing Aesthetic Image Generation via Composition Transfer
摘要
构图是视觉美学的基石,影响图像的吸引力。虽然其原理独立于具体内容而运作,但在实践中,组合通常与语义结合在一起。因此,现有方法通常通过隐式学习或基于语义的布局控制来增强合成,而不是显式地对合成本身进行建模。为了解决这一差距,我们引入了 Composer,这是一个植根于美学理论的框架,旨在以语义不可知的方式对构图进行建模。首先,它通过从参考图像中提取关键的构图感知表示并利用定制的条件指导模块来基于预训练的扩散模型控制构图来支持构图传输。其次,当用户仅指定文本主题而没有作文参考时,Composer 通过利用大型视觉语言模型 (LVLM) 的上下文学习功能来支持主题驱动的作文检索,从而实现明确的作文规划。为了增强无参考模式下的构图,我们在经过训练的控制模块上进行文本到构图 微调 以实现隐式构图规划。此外,我们使用最先进的生成模型创建了一个包含 200 万个图像文本对的高质量数据集来支持 模型训练。实验结果表明,Composer 显着提高了文本到图像任务的美学质量,并促进个性化的构图控制和传输,为用户的创作过程提供了精确性和灵活性。