论文

可扩展 VGGT 的多样性感知视图分区

Diversity-aware View Partitioning for Scalable VGGT

上下文与知识上下文工程

摘要

VGGT等几何Transformer通过全局注意力的多个视图的联合推理实现了强大的性能。然而,由于注意力的二次成本,将它们扩展到大视图集合仍然具有挑战性。此外,我们的实证分析表明,VGGT 中的重建质量对视点的分布很敏感。在没有足够观点多样性的情况下简单地增加视图数量甚至会降低性能,因为冗余视图引入了高度相似的标记,从而稀释了注意力机制中信息丰富的几何信号。受这一观察的启发,我们提出了 无需训练 和即插即用 VGGT 推理框架,将视图组织成多样性感知的平衡块。这些块是通过视觉差异和空间分散的组合图划分来构建的。这种视图组织允许 Transformer 将注意力集中在几何信息视图上,同时减少冗余的注意力交互。为了在没有完整姿态估计的情况下估计空间色散,我们通过基于一小组种子帧的视觉相似性的软姿态传播策略来近似空间关系。大量实验表明,相机姿态估计、多视图深度预测和 3D 重建的性能得到提高,同时减少了内存使用和推理延迟。我们的框架还补充了现有的 VGGT 变体,在不牺牲几何保真度的情况下实现可扩展的多视图重建。