论文

标准化对象坐标空间中生成视图合成的全局姿态控制

Global Pose Control for Generative View Synthesis in Normalized Object Coordinate Space

应用与实践内容创作

摘要

新颖的视图合成 (NVS) 可以从单个或多个图像生成场景中看不见的视图,从而允许用户从任何角度自由探索对象。尽管最近针对此任务的生成模型取得了令人印象深刻的质量改进,但现有方法很难提供对目标视点的全局和直观控制,因为它们要么使用相对于输入的相机姿势,要么仅限于生成稀疏的全局视图。缺乏全局姿态控制严重限制了 NVS 可能实现的下游任务的数量。为了解决这个限制,我们提出了一种在可定制的标准化对象坐标空间(NOCS)中精确控制相机的新方法,需要单个或几个未摆姿势的图像。我们的方法仅对 NOCS 中目标视图的绝对相机位姿进行操作,无需输入图像的相对世界框架或相机位姿。与之前将 NVS 视为独立生成任务的方法不同,我们将其表述为图像编辑问题,并建立在最先进的编辑模型的基础上,以利用其卓越的泛化能力。相机信息通过上下文中的多模态调节策略作为专用相机词元注入。为了减轻 NOCS 固有的模糊性,我们结合了明确定义对象规范坐标系的文本描述,这也增强了对未见过的对象类别的泛化。此外,我们还策划了一个高质量的数据集,其方向和相应的 NOCS 文本定义保持一致。大量的实验表明,我们的方法可以从不同类别的任意未摆出的图像中稳健地生成具有准确且一致方向的新颖视图,从而实现最先进的图像质量和保真度。