论文

Lite3R:用于高效前馈 3D 重建的模型无关框架

Lite3R: A Model-Agnostic Framework for Efficient Feed-Forward 3D Reconstruction

摘要

基于 Transformer 的 3D 重建已成为从多视图观察中恢复几何和外观的强大范例,在具有挑战性的视觉条件下提供强大的性能。随着这些模型扩展到更大的主干网和更高分辨率的输入,提高其效率对于实际部署变得越来越重要。然而,现代 3D Transformer 管道面临两个相互关联的挑战:密集的多视图注意力会产生大量的词元混合开销,而低精度执行可能会破坏几何敏感表示的稳定性并降低深度、姿态和 3D 一致性。为了解决第一个挑战,我们提出了 Lite3R,这是一种与模型无关的师生框架,用稀疏线性注意力取代密集注意力,以保留重要的几何交互,同时降低注意力成本。为了解决第二个挑战,我们引入了一种具有部分注意力的参数高效 FP8 感知量化感知训练(FP8 感知 QAT)策略 蒸馏,该策略冻结绝大多数预训练的骨干参数并仅训练轻量级线性分支投影层,从而实现稳定的低精度部署,同时保留预训练的几何先验。我们进一步在两个代表性骨干网 VGGT 和 DA3-Large 上相对于 BlendedMVS 和 DTU64 评估 Lite3R,结果表明它大大减少了延迟 (1.7-2.0x) 和内存使用量 (1.9-2.4x),同时保持了整体有竞争力的重建质量。这些结果表明,Lite3R 为基于 Transformer 的实际 3D 重建提供了有效的算法系统协同设计方法。代码:https://github.com/AIGeeksGroup/Lite3R。网站:https://aigeeksgroup.github.io/Lite3R。