论文

并非所有任务均等量化:Fisher 引导的视觉几何量化 Transformer

Not All Tasks Quantize Equally: Fisher-Guided Quantization for Visual Geometry Transformer

摘要

以 Visual Geometry Grounded Transformer (VGGT) 为代表的前馈 3D 重建模型可在单次前向传递中联合预测多个视觉几何任务,例如深度估计、相机姿态预测和点云重建。它们已广泛应用于 3D 视觉应用中,但其数十亿级的参数带来了大量的内存和计算开销,给设备上的部署带来了挑战。 后训练 量化 (PTQ) 是减少这种开销的有效技术。现有的前馈 3D 模型 PTQ 方法主要侧重于处理重尾激活分布和构建不同的校准数据集。然而,我们观察到前馈 3D 模型通过共享主干来预测多个几何属性,其中不同的 Transformer 块和隐藏通道对每个任务的贡献明显不同,导致跨任务、块和通道对量化误差的敏感度显着不同。因此,同等对待所有任务会过分强调不敏感任务,并导致敏感任务的准确性显着下降。为了解决这个问题,我们提出了用于前馈 3D 重建模型的 Fisher 引导量化 (FGQ)。具体来说,FGQ 使用对角费舍尔信息矩阵来量化跨任务、块和通道的不同敏感度,并在校准过程中将这些敏感度合并到可学习仿射变换中,以更好地保留对每个任务最关键的通道和块。跨相机姿态估计、点图重建和深度估计的大量实验表明,FGQ 始终优于 VGGT 上最先进的量化基线,在 4 位量化下实现高达 39% 的相对改进。代码可在 https://github.com/ypzhng/FGQ 获取。