论文
GeoSAM-3D:用于单目视频开放词汇 3D 场景分割的测地线提示传播
GeoSAM-3D: Geodesic Prompt Propagation for Open-Vocabulary 3D Scene Segmentation from Monocular Video
摘要
开放词汇 3D 场景分割通常采用 RGB-D 视频、校准的多视图图像或重建的网格。 GeoSAM-3D 研究了一种更轻松的设置:用户上传一段短单眼视频,单击或命名一帧中的对象,然后在高斯场景上接收传播的 3D 掩模。该实现将冻结图像和视频基础模型与单目 3D 高斯泼溅重建和高斯质心上的可微图测地线传播内核相结合。核心设计选择是通过重建场景图上的热核距离来传播提示,而不是通过 3D 中的欧几里得最近邻来传播提示。这可以保持弯曲表面周围的连续性,并减少附近但不相连的物体上的泄漏。本文描述了存储库状态、在 geosam3d.propagate 中实现的数学内核、从 Segment Anything 掩码训练的特征头以及代码库中已存在的验证。评估协议将实现验证、图传播质量、泄漏控制和交互延迟分开。