论文

3D-Fixer:从单个图像粗到精地就地完成 3D 场景

3D-Fixer: Coarse-to-Fine In-place Completion for 3D Scenes from a Single Image

应用与实践内容创作

摘要

从单个视图生成组合 3D 场景需要同时恢复场景布局和 3D 资源。现有的方法主要分为两类:前馈生成方法和每实例生成方法。前者通过有效的网络推理直接预测具有显式 6DoF 姿势的 3D 资产,但它们对复杂场景的泛化能力较差。后者通过分而治之的策略提高泛化能力,但会受到耗时的姿态优化的影响。为了弥补这一差距,我们引入了 3D-Fixer,一种新颖的就地完成范例。具体来说,3D-Fixer 扩展了 3D 对象生成先验,以生成以原始位置的部分可见点云为条件的完整 3D 资产,这些资产是从几何估计方法获得的碎片几何中裁剪出来的。与之前需要显式姿势对齐的作品不同,3D-Fixer 使用碎片几何体作为空间锚点来保持布局保真度。其核心是,我们提出了一种从粗到细的生成方案来解决遮挡下的边界模糊性,并由双分支调节网络和用于稳定训练的遮挡鲁棒特征对齐(ORFA)策略支持。此外,为了解决数据稀缺瓶颈,我们提出了 ARSG-110K,这是迄今为止最大的场景级数据集,包含超过 110K 个不同场景和 300 万张高保真 3D 真值 带注释图像。大量实验表明,3D-Fixer 实现了最先进的几何精度,显着优于 MIDI 和 Gen3DSR 等基线,同时保持了扩散过程的效率。代码和数据将在 https://zx-yin.github.io/3dfixer 上公开提供。