论文
VGGT 系列是否需要所有层?
Does the VGGT Family Need All Its Layers?
摘要
需要前馈几何模型的哪些层来保留相机姿势和密集的 3D 结构?我们研究了 VGGT、$π^3$ 和 VGGT-$Ω$ 中的层冗余:3,018 个修剪配置,在四个室内和室外数据集的七个相机姿势和密集几何指标上进行评分。以下是四个发现:(i)可移除层聚集在两个冗余区域:一个占主导地位的早期区域和一个较窄的晚期区域,而跨越中间层的删除始终更具破坏性。这种重复出现的模式适用于模型、数据集和指标,并与文献中常见的中后期冗余形成鲜明对比。 (ii) 在这些区域内,我们观察到删除两个区间的联合退化大约是它们各自退化的总和,将剪枝搜索的模型评估数量从 $O(L^4)$ 减少到 $O(L^2)$,其中 $L$ 是聚合器深度。 (iii) 我们发现 CKA 为区间退化提供了一种更便宜的基于表示的代理,在修剪质量和校准成本之间提供了实际的权衡。 (iv) 闭式线性校准在剪枝后恢复精度,无需端到端再训练。最小二乘分析表明,对特殊词元和补丁词元使用共享映射通常会产生过多的重建损失,从而激发了词元感知恢复。仅适用于 100 个校准场景的恢复图可推广到保留的场景和未见过的数据集。由此产生的模型将聚合器参数减少高达 44%,同时保持与完整模型相当的精度。代码和实验结果将在我们的项目页面提供:https://xian-bei.github.io/vggt-family-layer-redundancy/