论文
QVGGT:后训练 量化视觉几何建模 Transformer
QVGGT: Post-Training Quantized Visual Geometry Grounded Transformer
摘要
借助 Visual Geometry Grounded Transformer (VGGT),直接从图像估计 3D 属性已经取得了快速进展,它可以在一次前向传递中预测相机参数、深度图和点云。然而,其1.2B参数规模严重限制了在无人机和移动AR设备等资源受限平台上的部署。为了解决这一限制,我们引入了 QVGGT,这是一种旨在压缩 VGGT 的定制量化框架。我们的方法始于观察 VGGT 中的 Transformer 块对量化表现出异质敏感性。因此,我们分析了每个块的量化灵敏度,并提出了一种选择性混合精度策略,为最脆弱的 Transformer 块分配更高的精度。为了解决高方差相机和寄存器标记引起的量化误差的放大问题,我们进一步引入了带有相机信息补偿的标记过滤,它从激活校准中消除了这些异常值,并使用 PCA 派生的全局补偿标记来恢复它们的几何线索。最后,我们开发了一种任务感知尺度搜索机制,不仅通过层重建,而且通过相机位姿、深度图和点图之间的多头监督和跨头几何一致性来评估候选量化尺度。对多个几何感知基准的大量实验表明,QVGGT 实现了近乎无损的 W4A16 量化,保留了所有 3D 预测头的准确性,同时与 FP32 相比,内存减少了 3$\sim$4.9$\times$,实际硬件加速高达 2.8$\times$。我们的方法使高保真 3D 感知在边缘设备上变得可行,从而能够在现实世界的受限环境中实际部署前馈 3D 重建模型。