PrePARE:冻结多视图几何的预 AA 词元修剪 Transformer
PrePARE: Pre-AA Token Pruning for Frozen Multi-View Geometry Transformers
摘要
多视图几何 Transformer 是前馈 3D 基础模型,可在单次前向传递中联合预测 N 个图像的深度图、点图和相机姿势。它们中的大多数构建在交替注意力(AA)堆栈上,其跨视图注意力运行在每个块中所有 N 个视图的补丁词元上,因此其成本以 N 为二次方增长:在 300 帧 ScanNetv2 剪辑上,VGGT 峰值为 72.3 GiB,而 MapAnything 不适合 93 GiB 卡。现有方法减少了 AA 堆栈内部的词元或注意力,因此完整的补丁网格仍然进入其中,并且编码器将其词元交给第一个 AA 块的预 AA 接口已被忽略。我们提出 PrePARE,它在前 AA 接口处修剪一次补丁词元,并在最后一个 AA 块之后恢复密集网格一次。然后,冻结的 AA 堆栈的每个块都在减少的词元上运行,而预测头接收完整的网格。词元评分器(由未修剪的 AA 堆栈如何使用每个词元进行监督)和特征引导恢复模块是唯一经过训练的部分。词元路由模块是基于规则的。在 N = 300 的 ScanNetv2 上,PrePARE 将 VGGT 的峰值内存减少了 80%,从 72.3 GiB 减少到 14.4 GiB,低于我们运行的每个 in-AA 方法,并且运行速度快了 5.4 倍,而其每个场景的切角距离在 50 个场景中的 34 个上低于未剪枝模型的距离(符号测试 p = 0.015)。在 pi^3 和 Depth Anything 3 上,它节省了 15% 和 20% 的峰值内存,其中 in-AA 方法最多节省 9%,并且在 1000 帧时,它是我们在一个 GPU 上运行的唯一适合 Depth Anything 3 和 MapAnything 的方法。