论文

DGSG-Mind:用于长期场景理解和基础的动态 3D 高斯场景图

DGSG-Mind: Dynamic 3D Gaussian Scene Graphs for Long-Term Scene Understanding and Grounding

应用与实践视觉感知与空间理解

摘要

将开放词汇语义信息集成到动态 3D 场景表示中对于长期的具体场景理解至关重要。然而,由于不完整的跨视图线索,现有方法经常遭受脆弱的实例关联,而它们处理对象级拓扑变化的能力有限,限制了机器人任务的长期执行。此外,当前的 3D 场景理解方法要么依赖于没有显式空间推理的简单特征匹配,要么假设离线 真值 3D 几何。为了应对这些挑战,我们提出了 DGSG-Mind,这是一种具有具体推理代理的混合实例感知 3D 高斯动态场景图系统。我们的系统将概率体素网格与显式 3D 高斯耦合,以实现鲁棒的跨模式实例融合和增量语义映射。它通过基于高斯的视觉重新定位和几何语义一致性指导下的局部屏蔽细化来处理动态变化。 DGSG-Mind 在实例高斯图的基础上,进一步构建了分层场景图,并开发了 3D Gaussian Mind,它集成了结构关系、空间语义信息和视觉注释的 RoI 高斯渲染,用于多模态推理。大量实验表明,DGSG-Mind 在自重建地图上操作的方法中实现了最佳的零样本 3DVG 性能,同时在 3D 开放词汇语义分割和场景重建方面也提供了强大的性能。我们进一步将 DGSG-Mind 部署在现实世界的机器人上,以展示其面向目标的推理和动态更新能力。 DGSG-Mind 的项目页面位于 https://icr-lab.github.io/DGSG-Mind