论文
SceneReGen:从单个图像生成重建 3D 场景
SceneReGen: Generative Reconstruction of 3D Scenes from a Single Image
摘要
单图像 3D 场景重建必须完成部分观察到的对象,并将它们连贯地放置在共享的观察对齐场景框架中。对象级生成先验提供了强大的完成能力,但它们的中心、尺度归一化输出通常在对象框架中表示,从而在对象生成和场景重建之间产生了基本的表示差距。我们引入了 SceneReGen,这是一个生成重建框架,它将场景重建重新解释为在共享的观察对齐场景框架中生成和组装完整的对象资产。 SceneReGen 通过选择性姿态分解解决生成重建差距:每个对象的观察方向直接编码在生成的网格中,而平移和比例则根据实例级和全局场景证据进行估计。给定场景图像和实例蒙版,几何编码器提取密集的线索;可学习的形状查询调节基于 DiT 的预训练 3D 生成器,以在观察到的方向上生成完整的网格,而位置查询融合对象和场景特征以将它们组装在共享框架中。在 3D-FUTURE 评估子集上,SceneReGen 在评估方法中实现了最佳场景级 CD、场景级 F-Score 和 3D 边界框 IoU,与最佳对象级 CD 并列,并在对象级 F-Score 中排名第二。自动驾驶和人工智能场景的定性输出进一步说明了以资产为中心的重建在室内家具之外的潜力。