论文

VGGT-Ω:扩展前馈三维重建模型

VGGT-$Ω$

模型架构Transformer

摘要

最近的前馈重建模型(例如 VGGT)已被证明与传统的基于优化的重建器具有竞争力,同时还提供对其他任务有用的几何感知功能。在这里,我们表明这些模型的质量可预测地随着模型和数据大小而变化。为此,我们引入了 VGGT-$Ω$,它大大提高了静态和动态场景的重建精度、效率和能力。为了能够以前所未有的规模训练该模型,我们引入了提高训练效率的架构更改、支持动态场景的高质量数据注释管道以及自我监督学习协议。我们通过使用具有多任务监督的单个密集预测头并删除昂贵的高分辨率卷积层来简化 VGGT 的架构。我们还使用寄存器将场景信息聚合成紧凑的表示,并引入寄存器注意力,这限制了这些寄存器的帧间信息交换,部分取代了全局注意力。这样,在训练过程中,VGGT-$Ω$ 仅使用其前身的约 30% 的 GPU 内存,使我们能够使用比之前多 15 倍的监督数据进行训练,并利用大量未标记的视频数据。 VGGT-$Ω$ 在多个基准测试中的静态和动态场景重建方面取得了优异的成绩,例如,比 Sintel 上之前最好的相机估计精度提高了 77%。我们还表明,学习的寄存器可以改进视觉-语言-动作模型并支持与语言的对齐,这表明重建可以成为空间理解的强大且可扩展的代理任务。项目页面:http://vggt-omega.github.io/