论文

将多视图图像的 3D 生成先验缩放为大规模场景网格

Scaling 3D Generative Priors to Large-Scale Scene Meshes from Multi-View Images

模型推理解码与生成控制

摘要

预训练的 3D 生成模型可生成详细的几何形状和外观,但主要设计用于在有限的空间范围内以对象为中心的生成。最近的方法通过将大场景划分为更小的空间区域并对每个区域应用预训练的 3D 生成先验来解决这一限制。然而,将平铺生成扩展到大型多视图场景使得保持局部几何连续性和全局外观一致性变得具有挑战性。我们提出了一个 无需训练 框架,用于从多视图图像生成大规模纹理网格。我们的关键思想是将平铺生成扩展到具有更多空间细节的大场景,同时协调本地和全局的生成。我们引入局部上下文平铺生成来提高相邻区域之间的几何连续性,并引入全局外观对齐来减少远处区域之间的外观差异。自适应场景分解进一步根据输入场景几何形状确定图块的数量。实验证明,与现有方法相比,几何和外观保真度有所提高,同时能够细粒度地生成大规模场景。