论文

梵高眼中的全球风格转移与扩散模型

Through Van Gogh's Eyes: Global Style Transfer with Diffusion Model

模型推理解码与生成控制

摘要

艺术图像合成旨在重建目标艺术家富有表现力的视觉身份,但现有方法往往无法捕捉艺术家的整体风格。传统的风格转移方法以一对一的方式将一件或几件参考艺术品的风格转移到内容图像,这使得它们对于艺术品级别的风格化很有效,但在代表艺术家更广泛的风格分布方面受到限制。以艺术家姓名为条件的文本到图像扩散模型(例如“梵高风格的~”)提供了更大的灵活性,但它们经常受到文本引起的偏差的影响,并且只能复制少数标志性作品的模式。为了解决这些限制,我们引入了全局风格转移(GST),这是一种艺术图像合成范例,以多对一的方式聚合来自目标艺术家的多个艺术作品,并将其共享的全局风格转移到单个内容图像。对于 GST,我们提出了全局风格指导(GSG),它在固定提示下学习扩散模型的中间特征空间或 h 空间中的剩余全局风格偏移。通过纯粹从视觉统计中学习艺术家级别的风格语义,GSG 减轻了依赖于文本的艺术偏见。我们进一步提出内容对齐指导(CAG),这是一种 无需训练 感知指导机制,可以保留内容图像的语义结构,同时允许艺术家特定的几何变形。 WikiArt 上的实验表明,与现有的风格迁移和基于扩散的艺术合成方法相比,GST 实现了卓越的风格保真度、内容保存和输出多样性。