论文

局部思考、全局优化以实现内存高效的 3D 重建

Think Locally, Refine Globally for Memory-Efficient 3D Reconstruction

模型架构Transformer

摘要

我们提出了 LoG-VGGT,这是一种用于长序列 3D 重建的内存高效框架,可平衡局部时间建模与全局相机一致性。我们的方法不依赖于完全的全局注意力,而是在Transformer块的一个小子集上引入跨窗口注意力,从而实现跨相邻时间窗口的有效信息传播,同时保持内存使用有限。为了减轻长期姿势漂移,我们进一步设计了一个全局相机一致性细化模块,其中相机词元通过交叉注意力与紧凑寄存器词元交互,以在整个序列中强制执行场景级约束。这种设计能够联合优化相机表示,并显着提高长视距姿态稳定性,而不会产生序列范围注意力的高成本。大量实验表明,LoG-VGGT 在多个长序列基准测试中实现了更高的深度精度和稳健的相机姿态估计,同时提供具有竞争力的流式重建性能。