论文

RoSe-SLAM:来自动态单目视频的鲁棒语义感知高斯泼溅 SLAM

RoSe-SLAM: Robust Semantic-Aware Gaussian Splatting SLAM from Dynamic Monocular Videos

应用与实践视觉感知与空间理解

摘要

在动态和非结构化环境中,传统 SLAM 系统通常会因其静态假设而遭受严重的精度退化。在这项工作中,我们提出了鲁棒语义感知高斯泼溅 SLAM (RoSe-SLAM),通过未校准的单目输入的整体语义场景理解来解决动态挑战,实现精确的相机跟踪和高质量的几何重建。与使用手工制作的语义标签的传统语义 SLAM 不同,我们的 RoSe-SLAM 利用 2D 基础模型的语义特征来增强动态跟踪和建图性能。通过将丰富的语义特征提炼到高斯场中,我们的方法有效地识别动态干扰因素并实现语义感知的多视图一致性,从而显着增强几何重建和场景修复。具体来说,我们提出了一种时空运动掩模生成模块,可以实现长期运动监测和短期瞬态动态捕获,从而实现动态对象和静态背景的稳健有效的解开。在全局捆绑调整期间,我们提出了一种遮挡感知关键帧选择机制,将遮挡优先作为选择关键帧的度量,并提出了多视图语义一致性模块来提高动态环境中的映射质量。通过将几何运动线索与语义先验相结合,我们的系统动态过滤不可靠的观察结果并重建准确的静态场景几何形状。在包括动态 TUM、Bonn 和 Wild-Mocap 数据集在内的基准数据集上进行的大量实验表明,我们的方法在轨迹估计和静态场景映射方面均实现了卓越的性能,在长期动态室内环境中优于现有的动态 RGB SLAM 基线。