论文
DeWorldSG:通过世界模型先验生成深度感知 3D 语义场景图
DeWorldSG: Depth-Aware 3D Semantic Scene Graph Generation via World-Model Priors
摘要
我们提出了 DeWorldSG,这是一种新颖的框架,可以从 RGB-D 序列生成时空鲁棒的 3D 语义场景图。由于不稳定的 3D 对象表示和逐帧推理导致的关系缺失,现有方法通常难以构建可靠的 3D 场景图。 DeWorldSG 通过深度引导过滤来估计实例级几何 3D 高斯分布,并将每个对象表示为概率 3D 节点而不是单个投影点,从而解决了这些问题。为了减轻逐帧推理的关系稀疏性,我们的框架进一步聚合了对象对之间的时空证据,并使用从世界模型导出的上下文先验来细化关系(V-JEPA 2)。 3DSSG 和 ReplicaSSG 数据集上的实验展示了对象和谓词预测方面最先进的 (SoTA) 性能,同时生成时间一致的场景结构。特别是,与之前的 SoTA 方法相比,我们的方法将三元组召回率提高了 77.4%,将谓词召回率提高了 23.2%,使其适合机器人操作和 AR 应用。我们的代码和模型是开源的。