论文

Stream3Dv2:几何语义融合增强流式零镜头 3D 场景理解

Stream3Dv2: Geometric-Semantic Fusion Enhanced Streaming Zero-Shot 3D Scene Understanding

应用与实践视觉感知与空间理解

摘要

最近,使用视觉基础模型的开放词汇零样本 3D 场景理解已成为数据密集型监督方法的有前途的替代方案。然而,在现实场景中部署这些模型受到严重阻碍,因为它们无法有效处理流式 RGB-D 输入以及它们固有的易受噪声 2D 分割掩模影响的弱点。为了解决这些关键限制,我们提出了 Stream3Dv2,这是一种新颖的 无需训练 框架,专为强大的流式 3D 感知而设计。 Stream3Dv2通过原始的嵌套本地到历史架构处理顺序数据,捕获多视图一致性,同时规避高计算开销,以支持及时响应。其核心是,我们引入了一种全面的几何语义融合机制,通过明确地利用语义指导和制定 3D 分割来解决点集合并和分区问题,从而解决几何噪声和语义歧义。此外,我们提出了一种创新的基于流形距离的点云细化策略。该方法利用局部流形图进行点到流形优化,减轻由欧几里德距离度量引起的边界描绘失败,并采用几何边界框动态激活和更新历史实例,以实现快速流形到流形细化。对公共数据集的大量实验表明,Stream3Dv2 在基础开放词汇流式 3D 分割和检测方面始终优于现有基线。最后,我们展示了将我们的框架与基于 LLM 的代理集成可以实现高级语言驱动的 3D 场景理解,强调其开放世界体现智能的潜力。代码将在 https://github.com/SubmissionsIn/Stream3D 更新。