论文

TurboVGGT:具有自适应交替注意力的快速视觉几何重建

TurboVGGT: Fast Visual Geometry Reconstruction with Adaptive Alternating Attention

模型架构Transformer

摘要

最近的前馈 3D 重建方法(例如视觉几何 Transformer)通过在单次前向传递中实现有效的多视图重建,大大改进了传统的每场景优化范例。然而,大多数现有方法都难以在重建质量和计算效率之间取得平衡,这限制了它们的可扩展性和效率。尽管最近出现了一些高效的视觉几何 Transformer,但它们通常在层和帧之间使用相同的稀疏率,并且缺乏自适应学习代表性标记以捕获全局关系的机制,从而导致性能不佳。在这项工作中,我们提出了 TurboVGGT,这是一种采用高效视觉几何 Transformer 的新颖方法,具有自适应交替注意力,可实现快速多视图 3D 重建。具体来说,TurboVGGT 采用端到端可训练框架,具有由自适应稀疏选择引导的自适应稀疏全局注意力,以捕获跨帧的全局关系和帧注意力以聚合每个帧内的局部细节。在自适应稀疏全局注意力中,TurboVGGT 自适应地学习具有不同稀疏级别的代表性词元以进行全局几何建模,考虑到词元重要性在不同帧之间变化,注意力层在不同的抽象级别上操作词元,并且全局依赖性依赖于结构信息区域。对多个 3D 重建基准的大量实验表明,与最先进的方法相比,TurboVGGT 可以实现快速多视图重建,同时保持有竞争力的重建质量。项目页面:https://turboggt.github.io/。