论文

VGGT-Segmentor:几何增强的跨视图分割

VGGT-Segmentor: Geometry-Enhanced Cross-View Segmentation

应用与实践视觉感知与空间理解

摘要

跨不同的自我中心和外中心视图的实例级对象分割是视觉理解中的一个基本挑战,对于具体人工智能和远程协作中的应用程序至关重要。由于尺度、视角和遮挡的严重变化,这会破坏直接像素级匹配的稳定性,因此这项任务异常困难。虽然像 VGGT 这样的最新几何感知模型为特征对齐提供了坚实的基础,但我们发现,由于显着的像素级投影漂移,它们经常在密集的预测任务中失败,即使它们的内部对象级注意力保持一致。为了弥补这一差距,我们引入了 VGGT-Segmentor (VGGT-S),这是一个将稳健的几何建模与像素精确的语义分割相结合的框架。 VGGT-S 利用 VGGT 强大的跨视图特征表示,并引入了新颖的 Union Segmentation Head。该头分三个阶段运行:掩模提示融合、点引导预测和迭代掩模细化,有效地将高级特征对齐转换为精确的分割掩模。此外,我们提出了一种单图像自监督训练策略,消除了配对注释的需要并实现了强泛化。在 Ego-Exo4D 基准上,VGGT-S 创下了新的最先进水平,Ego 到 Exo 和 Exo 到 Ego 任务的平均 IoU 分别达到 67.7% 和 68.0%,显着优于之前的方法。值得注意的是,我们的无通信预训练模型超越了大多数完全监督的基线,证明了我们方法的有效性和可扩展性。代码公开于:https://github.com/buaa-colalab/VGGT-S。