论文

Chameleon:用于跨域对象合成的样式内容分离框架

Chameleon: Style-Content Disentangled Framework for Cross-Domain Object Compositing

应用与实践内容创作

摘要

图像合成的目的是将前景对象无缝插入到背景图像中,扩散模型的最新进展显着提高了质量,特别是当前景和背景图像来自同一域(例如自然图像)时。然而,前景和背景来自不同域的跨域合成尚未得到充分探索,并且仍然具有挑战性,因为模型必须保留前景对象的身份,同时对其进行样式化以匹配背景域。现有的跨域合成方法很大程度上依赖于 无需训练 混合和细化策略。部分原因是缺乏大规模配对数据集,限制了基于训练的解决方案的开发。因此,它们仅限于色调级别对齐,并且经常产生风格不一致或过度风格化的结果。为了克服这些限制,我们构建了 ChameleonDataset,这是第一个用于跨域合成的大规模训练数据集,具有通过可扩展的数据构建管道构建的全面评估基准。在此基础上,我们提出了 Chameleon,一种新颖的基于两阶段训练的跨域合成框架。在第一阶段,我们提出签名样式内容图学习(SSCGL)来训练 ChameleonEncoder,它有效地解开了样式和内容表示。在第二阶段,我们将风格间隙感知各向异性调制(SGAM)引入到扩散Transformer中,以进行有效的跨域合成,根据前景-背景风格间隙、空间区域和扩散时间步长自适应地调节来自第一阶段ChameleonEncoder的风格标记的注入方式。我们的方法优于最先进的域内和跨域合成模型、顺序管道和商业模型,实现了构图合理性和风格保真度的改进。