论文

SAF3R:用于前馈 3D 重建的动态稀疏注意力 Transformer

SAF3R: Dynamic Sparse Attention for Feed-Forward 3D Reconstruction Transformers

模型推理推理加速

摘要

前馈 3D 重建 (F3R) Transformer 最近取得了显着的成功。然而,将它们缩放到长图像序列仍然具有挑战性,因为跨视图全局注意力的二次复杂性很快成为主要的计算瓶颈。虽然最近的努力试图通过压缩或稀疏注意力来提高效率,但它们未能充分利用全局注意力固有的稀疏性和动态行为。在这项工作中,我们对多个 F3R Transformer 的全局注意力进行了全面分析,并揭示了注意力模式在各层和注意力头之间是高度异构、动态且极其稀疏的。受这些发现的启发,我们提出了 SAF3R,这是一种专为 F3R Transformer 量身定制的 无需训练 动态稀疏注意力框架。 SAF3R 将定制的稀疏注意力机制与离线头部分析和高效的在线适应策略相结合,以匹配依赖于输入的注意力行为。大量实验表明,SAF3R 实现了高稀疏率,同时保留了相机姿态估计和 3D 重建质量,与现有方法相比,F3R Transformer 实现了显着的端到端加速。代码可在 https://github.com/jndeng/SAF3R 获取