论文
Extend3D:城镇规模的 3D 生成
Extend3D: Town-Scale 3D Generation
摘要
在本文中,我们提出了 Extend3D,这是一个 无需训练 管道,用于从单个图像生成 3D 场景,建立在以对象为中心的 3D 生成模型之上。为了克服以对象为中心的模型中用于表示宽场景的固定大小潜在空间的限制,我们在 $x$ 和 $y$ 方向上扩展了潜在空间。然后,通过将扩展的潜在空间划分为重叠的补丁,我们将以对象为中心的 3D 生成模型应用于每个补丁,并在每个时间步将它们耦合。由于使用图像调节的逐块 3D 生成需要图像和潜在块之间严格的空间对齐,因此我们使用单目深度估计器先验的点云来初始化场景,并通过 SDEdit 迭代细化遮挡区域。我们发现,在 3D 细化过程中将 3D 结构的不完整性视为噪声,可以通过一个概念实现 3D 完成,我们将其称为低噪声。此外,为了解决以对象为中心的子场景生成模型的次优性,我们优化了去噪期间的扩展潜伏,确保去噪轨迹与子场景动态保持一致。为此,我们引入了 3D 感知优化目标,以改进几何结构和纹理保真度。我们证明,我们的方法比以前的方法产生更好的结果,正如人类偏好和定量实验所证明的那样。