论文

VGGT-Prime:用于高效视觉几何变换器的计算自适应混合头

VGGT-Prime: Compute-Adaptive Mixture-of-Heads for Efficient Visual Geometry Transformers

模型推理推理加速

摘要

前馈视觉几何模型(例如 Visual Geometry Grounded Transformer (VGGT))最近支持从多视图图像进行直接 3D 重建。尽管它们的性能很有前途,但由于它们的全局注意力机制,这些模型随着输入视图的数量呈二次方扩展,从而导致长序列输入的大量延迟。最近有一些加速 VGGT 的努力,但它们主要侧重于通过词元合并或键/值稀疏来减少 emph{词元冗余}。我们的工作通过研究视觉几何变换器中的\emph{架构冗余},从不同的角度解决了这个瓶颈。我们证明了 VGGT 全局注意力层中的多头注意力模块包含大量的架构冗余,只有一部分头携带关键的几何信息。根据这一观察,我们提出了 VGGT-Prime,这是一种计算自适应混合头模型,可以解决这种冗余问题,以加速视觉几何变换器,同时保持有竞争力的重建质量。 VGGT-Prime 的关键思想是使用轻量级路由器估计每个全局注意力头的适当计算级别,然后动态地将每个头分配给不同的计算模式。对多个数据集的大量实验表明,VGGT-Prime 可以比 VGGT 实现 {$8\times$} 的推理加速,同时保持相机姿态、深度和点云预测方面的竞争性能。我们进一步表明,VGGT-Prime 是对现有加速方法(例如词元合并)的补充,与 VGGT 相比,进一步将推理速度提高了 14{\times}$。我们的工作概述可以在我们的 \href{此 https URL}{项目页面} 上找到。