论文

用于可扩展 3D 映射、本地化和渲染的自适应世界记忆 3D 基础模型

Adaptive World Memory 3D Foundation Model for Scalable 3D Mapping, Localization, and Rendering

摘要

最近的 3D 基础模型支持从 RGB 图像进行通用几何推理,但在持久内存、可扩展性和可渲染场景建模方面仍然受到限制。我们提出了一个以内存为中心的 3D 基础模型,用于可扩展的机器人定位、重建和高斯渲染。其核心是一种自适应世界记忆机制,将基于Transformer的门控更新与测试时时空调节相结合。学习门控制循环记忆传播,而时间状态演化和空间观察状态一致性则调节长图像序列上的标记更新和遗忘。为了支持大规模映射,我们将内存组织成局部子映射,并集成渐进式映射和跟踪、循环闭合以及基于 SL(4) 的全局细化,以保持局部准确性和全局一致性。高斯重建头将内存增强型特征解码为可渲染基元,在单个模型中统一相机姿态估计、密集点云重建和真实感渲染。对来自不同机器人平台的公共基准和自行收集的数据集进行的实验表明,与现有 3D 基础重建和 SLAM 基线相比,轨迹精度、重建完整性和渲染质量都有所提高。这些结果支持自适应记忆作为持久机器人世界建模的基础。数据集和代码将在 \href{this https URL}{this https URL} 公开提供。