论文
GATOR:从休闲图像中生成和 Agentic 3D 对象重建
GATOR: Generative and Agentic 3D Object Reconstruction From Casual Images
摘要
从随意图像中重建完整的、与场景对齐的 3D 对象需要集成稀疏、不确定的观察结果并推断被遮挡隐藏的表面。我们提出了 GATOR,这是一种生成式 agentic 框架,可以从一张或多张图像中恢复纹理对象资产及其场景相关姿势。我们的局部模态混合器在跨视图推理之前耦合补丁对齐的 RGB、目标蒙版和点图特征,保留场景上下文,同时将目标与其周围环境区分开来。文本引导的语义条件通过用于结构、几何和外观生成的阶段特定适配器,用类别名称和对象标题补充这些空间线索。生成的资产初始化多模式代理,通过观察引导的编辑-渲染-审查循环提供特定于实例的几何形状和姿势,以实现目标结构和纹理细化。在合成物体、杂乱的桌面和室内场景中,GATOR 实现了强大的几何和外观保真度,同时从稀疏的观察中恢复场景相关的姿势。 时间预算比较和场景级仿真进一步证明了重建效率和仿真准备度。项目页面:https://research.nvidia.com/labs/lpr/gator/