论文
Fysiverse-3D-Vision技术报告:通过统一空间推理从图像生成可执行的3D世界
Fysiverse-3D-Vision Technical Report: Generating Executable 3D Worlds from Images through Unified Spatial Reasoning
摘要
生成模型具有先进的图像调节 3D 内容创建功能,但从单个图像生成可控且可执行的 3D 场景仍然具有挑战性。现有的 3D 生成方法可以合成视觉上合理的对象和场景,但它们的空间布局估计与特定的资产生成器相结合。他们努力联合建模对象语义、度量几何和场景级空间关系,这对于交互式编辑、物理模拟和具体应用程序至关重要。我们提出了 Fysiverse-3D-Vision,这是一个统一的视觉-语言-几何框架,用于从单个图像生成 3D 场景重建和可执行资产构建。我们建立了一个共享表示,其中空间推理和几何重建相互增强,允许推断对象布局超出单个资产生成器的限制。我们的模型将文本监督、语义视觉提示和几何表示集成在统一的 Transformer 中,以捕获场景上下文、度量几何和对象级交互。对象条件布局模块在目标对象表示和全局几何特征之间执行交叉注意,以预测对象平移、旋转和缩放。训练逐步学习几何语言对齐,在保留重建能力的同时引入布局推理,并通过碰撞感知优化来完善物理一致性。通过将空间布局推理与资产合成分离,Fysiverse-3D-Vision 为交互式场景编辑、对象级操作和可执行 3D 内容生成提供了一个适应性强的界面。实验表明,与现有方法相比,我们的框架实现了卓越的几何一致性、布局估计、渲染质量和物理属性理解。