论文

通过学习视点标记生成文本到图像的相机控制

Camera Control for Text-to-Image Generation via Learning Viewpoint Tokens

应用与实践内容创作

摘要

当前的文本到图像模型很难仅使用自然语言提供精确的相机控制。在这项工作中,我们通过学习参数相机标记,提出了一个在文本到图像生成中具有全局场景理解的精确相机控制框架。我们在精选数据集上微调图像生成模型,以实现视点条件文本到图像的生成,该数据集结合了用于几何监督的 3D 渲染图像和用于外观和背景多样性的真实感增强。定性和定量实验表明,我们的方法在保持图像质量和即时保真度的同时实现了最先进的准确性。与之前过度拟合特定于对象的外观相关性的方法不同,我们的视点标记学习可转移到未见过的对象类别的分解几何表示。我们的工作表明,文本视觉潜在空间可以被赋予明确的 3D 相机结构,为生成文本到图像的几何感知提示提供了一条途径。项目页面:https://raddl.github.io/viewtoken_control/