论文
LingBot-Map:用于流式 3D 重建的几何上下文 Transformer
LingBot-Map: Geometric Context Transformer for Streaming 3D Reconstruction
摘要
流式 3D 重建旨在从视频流中恢复 3D 信息,例如相机姿态和点云,这需要几何精度、时间一致性和计算效率。受同步定位与建图 (SLAM) 原理的启发,我们引入了 LingBot-Map,这是一种前馈 3D 基础模型,用于从流数据重建场景,建立在几何上下文 Transformer (GCT) 架构之上。 LingBot-Map 的一个决定性方面在于其精心设计的注意力机制,该机制集成了锚点上下文、姿势参考窗口和轨迹记忆,分别用于解决坐标基础、密集几何线索和远程漂移校正问题。此设计保持流状态紧凑,同时保留丰富的几何上下文,从而能够在超过 10,000 帧的长序列上以 20 FPS 左右的速度对 518 x 378 分辨率输入进行稳定高效的推理。跨各种基准的广泛评估表明,与现有的流式传输和基于迭代优化的方法相比,我们的方法实现了卓越的性能。