论文

MULTI:解开相机镜头、传感器、视图和域以生成新图像

MULTI: Disentangling Camera Lens, Sensor, View, and Domain for Novel Image Generation

应用与实践内容创作

摘要

最近的文本到图像模型可以生成高质量的图像,但当需要特定样式或对象时,文本模糊性会阻碍精确控制。最近有许多涉及学习和组合多个对象和模式的作品。然而,当前的工作几乎完全集中在图像内容上,忽略了相机镜头、传感器类型、成像视点和场景域特征等成像因素。我们将这一新挑战称为“成像因子解缠”,并展示了该体系中当前方法的局限性。因此,我们提出了新方法“通过文本反转进行多因素解缠”(MULTI)。它由两个阶段组成:在第一阶段,我们学习一般因素,在第二阶段,我们提取数据集特定的因素。这种设置可以扩展现有数据集和新颖的因素组合,从而减少分布差距。它还支持通过 ControlNet 修改特定因素和图像到图像的生成。对我们新的 DF-RICO 基准的评估证明了 MULTI 的有效性,并强调了因子解缠作为新研究方向的重要性。