论文
RelationVGGT:用于 3D 空间关系分割的视觉几何Transformer
RelationVGGT: Visual Geometry Transformers for 3D Spatial Relation Segmentation
摘要
3D 重建的最新进展已经从按场景优化发展到前馈推理,语义场景理解也随之发展——但现有方法仍然局限于以对象为中心的感知,忽略了对象之间的空间关系。我们在前馈、无姿势多视图设置中制定 3D 空间关系分割:给定视觉指定的主题和关系文本查询,模型跨视图分割目标,而不接收其类别名称。为此,我们提出了 RelationVGGT,这是一种新颖的前馈框架,它将视觉基础模型的语义特征与 3D 几何基础模型的几何感知表示相集成,并利用关系Transformer进行主题条件、跨视图关系预测——既不需要每个场景的优化,也不需要已知的相机姿势。我们还提供了一个基于 ScanNet++ 构建的全自动注释管道,带有 VLM 和 LLM,从而为这项新任务生成可扩展的训练数据。