论文

WorldMesh:通过网格条件图像扩散生成可导航的多房间 3D 场景

WorldMesh: Generating Navigable Multi-Room 3D Scenes via Mesh-Conditioned Image Diffusion

应用与实践内容创作

摘要

图像和视频合成领域的最新进展激发了它们在推进 3D 场景生成方面的应用。然而,我们观察到,文本到图像和视频的方法很难在有限的环境规模之外维持场景和对象级的一致性,而没有持久、明确的几何表示。因此,我们提出了一种几何优先的方法,将大规模 3D 场景合成的复杂问题分解为其结构组成(表示为网格支架)和逼真的外观合成,该合成利用了以网格支架为条件的强大图像合成模型。根据输入的文本描述,我们首先构建一个捕获环境几何形状(墙壁、地板等)的网格,然后使用图像合成、分割和对象重建来使用真实布局中的对象填充网格结构。然后渲染该网格支架以调节图像合成,为一致的外观生成提供结构主干。这使得可扩展、任意大小的 3D 场景具有高对象丰富度和多样性,将强大的 3D 一致性与逼真的细节相结合。我们相信,这标志着向生成真正的环境规模、沉浸式 3D 世界迈出了重要一步。