论文

盒子里的思考:真实图像的 3D 编辑变得轻松

Thinking in Boxes: 3D Editing in Real Images Made Easy

应用与实践内容创作

摘要

文本和 2D 调节界面对图像编辑中的空间变换提供了微弱且模糊的控制,尤其是在大型物体运动和摄像机变化的情况下。之前的工作使用了 3D 图元(例如盒子),但仅作为指示大致对象位置的松散条件信号,而不是指定变换。相反,我们使用 3D 框作为结构化规范:用户提供编辑的输入和输出框,将编辑转换为适定的几何问题。这种“盒子思考”界面,其中每个盒子面都经过颜色编码以传达 3D 方向,可以精确控制真实图像中的平移、旋转、缩放和视点变化,同时保留场景和对象身份,并恢复以前未见过的对象区域。对于场景外观的地面变换,我们引入了深度对齐的平面地板作为全局参考框架,并用深度感知线索进行着色。以这种结构为条件,图像生成器在大变换下产生一致的结果。该系统分两个阶段进行训练——在合成的多对象场景和来自 Objectron 的一小组真实世界视频上——泛化到复杂的、野外的真实图像。我们的方法直接在真实照片上运行,并且在大型 3D 编辑方面远远优于最新的最先进方法。