论文
Scal3R:大规模 3D 重建的可扩展测试时间训练
Scal3R: Scalable Test-Time Training for Large-Scale 3D Reconstruction
摘要
本文解决了从长视频序列重建大规模 3D 场景的任务。最近的前馈重建模型通过直接从 RGB 图像回归 3D 几何而无需明确的 3D 先验或几何约束,显示出了有希望的结果。然而,由于内存容量有限且无法有效捕获全局上下文线索,这些方法通常很难在长序列上保持重建的准确性和一致性。相比之下,人类可以自然地利用对场景的全局理解来告知局部感知。受此启发,我们提出了一种新颖的神经全局上下文表示,可以有效地压缩和保留远程场景信息,使模型能够利用广泛的上下文线索来提高重建的准确性和一致性。上下文表示是通过一组轻量级神经子网络实现的,这些子网络在测试期间通过自监督目标快速适应,这大大增加了内存容量,而不会产生大量的计算开销。在多个大型基准上的实验,包括 KITTI Odometry~\cite{Geiger2012CVPR} 和 Oxford Spires~\cite{tao2025spires} 数据集,证明了我们的方法在处理超大型场景方面的有效性,在保持效率的同时实现了领先的姿态精度和最先进的 3D 重建精度。代码可在 https://zju3dv.github.io/scal3r 获取。