论文
通过物理世界建模统一 3D 场景理解
Unified 3D Scene Understanding Through Physical World Modeling
摘要
理解 3D 场景需要视觉推理任务的灵活组合,包括深度估计、新颖的视图合成和对象操作,所有这些对于感知和交互都是至关重要的。现有方法通常孤立地处理这些任务,阻止它们共享通用表示或跨任务传输知识。一个概念上更简单但实际上并不简单的替代方案是将这些不同的任务统一到一个模型中,将不同的任务从单独的训练目标减少到仅仅不同的提示,并允许跨所有数据集进行联合训练。在这项工作中,我们提出了一个用于统一 3D 理解和交互 (3WM) 的物理世界模型,该模型被表述为概率图形模型,其中节点表示多模态场景元素,例如 RGB、光流和相机姿态。通过图表,不同的推理路径产生了不同的任务:来自 RGB 和密集流提示的新颖视图合成、来自 RGB 和稀疏流提示的对象操作、以及来自 RGB 和相机调节的深度估计,所有这些都是零样本,无需特定于任务的训练。 3WM 无需进行微调,即可在现实场景中提供精确的可控性、强大的几何一致性和鲁棒性,从而超越专用基线,从而在 NVS 和 3D 对象操作方面实现最先进的性能。除了预定义的任务之外,该模型还支持可组合的推理路径,例如在 3D 环境中导航时将对象移到一边,从而实现复杂的几何推理。这表明统一模型可以作为碎片化特定任务系统的实用替代方案,向通用视觉世界模型迈出了一步。