论文
VGGT 对重叠的了解:探索几何基础模型的共同可见性
What VGGT Knows About Overlap: Probing Geometric Foundation Models for Co-Visibility
摘要
3D 重建和机器人定位的一个基本挑战是协同可见性:确定哪些图像对共享重叠的可见表面,特别是在重叠最小的场景中。我们证明 VGGT 隐式地将共同可见性编码为一种紧急行为:在没有对此任务进行任何监督的情况下,其内部表示呈现出清晰的分层结构,反映了 大语言模型 的结构,即早期层构建 3D 感知场景表示,而后期层充当专用的共同可见性推理器。特别是,我们将 L17 层确定为负锚,无论评估设置如何,始终为该主干路由非共可见对,从而在基于几何的基础模型中提供基于任务的层专业化证据。在此基础上,我们引入了 Co-VGGT,它冻结了 VGGT 并仅训练一个轻量级的逐层混合专家头(少于 750 万个参数)来对 RGB 的共同可见性进行分类,将每一层视为一个专门的专家,其几何抽象根据每个输入对进行自适应加权。在 Co-VisiON 基准上,Co-VGGT 超越了人类注释基线,并且比之前的工作改进了超过 25% 的成对和 10% 的多视图。成对预测经过良好校准 (ECE=0.030),可以直接用作下游 SfM 和 SLAM 管道可见性图中的边权重,无需事后校正。代码和数据可用。