论文
WorldSculpt:由多视角观测生成可组合的复杂三维场景
WorldSculpt: Generating Compositional Worlds from Grounded Videos
摘要
我们研究生成包含数百个对象的杂乱场景的组合 3D 表示的问题。目标是将场景表示为放置在共享世界框架中的单个对象网格的集合,按照游戏、AR/VR、模拟和机器人等下游应用程序的要求。这项任务在密集杂乱的场景中具有挑战性,其中对象彼此严重遮挡,并且每个视图仅显示其几何形状的一小部分。基于几何的方法通常将场景重建为单一表示,并在遮挡区域中留下不完整的几何形状,而现有的具有生成先验的合成方法在很大程度上仅限于相对简单的场景。我们证明,通过在多视图观察之前采用强大的单对象 3D 生成功能,可以组合地生成具有数百个对象的复杂场景。我们用 Pixal3D 实例化了这个范例,并通过多视图调节路径对其进行了扩展,该路径将对象生成基于多个姿势观察。尽管该模型完全针对规范空间中的单个对象进行微调,但它无需任何场景级训练即可推广到具有严重遮挡的大型场景,证明了该范例的可行性和可扩展性。我们进一步介绍 UE-MeshyScene,这是一个包含数百个对象、每个对象注释和 真值 网格的密集杂乱场景的真实感基准。在单对象、受控多对象和 UE-MeshyScene 评估中,我们的方法始终优于先前的方法,并且随着场景复杂性和遮挡的增加而获得更大的收益。最后,我们通过将生成的 3DGS 世界(例如 Marble 和 HY-World 2.0)转换为组合网格场景来展示更广泛的适用性。