论文

RegimeVGGT:基于 Transformer 的视觉几何的逐层空间保留冗余消除

RegimeVGGT: Layer-Wise Spatially Preserving Redundancy Removal for Visual Geometry Grounded Transformer

模型推理推理加速

摘要

Visual Geometry Grounded Transformer (VGGT) 在一次前向传递中从多视图图像中恢复密集的 3D 场景结构,但二次跨帧注意限制了其可扩展性。现有的 无需训练 加速器沿一个轴均匀地减少计算,缺少层异构性。我们的光谱、探测和因果分析揭示了三种机制:浅层缺乏交叉视图结构,中间层驱动交叉视图对齐,深层对于密集几何来说是多余的,但它们的跨帧注意力对于姿势仍然至关重要。 RegimeVGGT 沿两个轴应用分层 U 形压缩:显着性引导带状合并保护几何和边缘显着标记,而选择性保护 K/V 下采样通过相移空间网格、参考帧锚点和未压缩的相机/寄存器标记保留跨帧空间覆盖和姿势关键路径。 无需训练,RegimeVGGT 在匹配的重建质量下实现了 VGGT* 6.7 倍的加速。