论文

S4VY:在前馈 4D 视觉几何中分割任何内容

S4VY: Segment Anything in Feed-Forward 4D Visual Geometry

应用与实践视觉感知与空间理解

摘要

动态场景中准确的实例分割对于机器人和自动驾驶等下游应用非常重要。现有的 Segment Anything 模型主要在 2D 图像或视频掩码上运行,并通过顺序内存保留身份,而基于前馈视觉几何图形构建的即时 4D 实例分割仍未得到充分探索。我们引入了 S4VY,一种基于前馈 4D 视觉几何构建的 Segment Anything 模型。 S4VY 通过时空查询解码器从一组 RGB 观察结果将共享的视觉几何特征转换为一组详尽的与类无关的 4D 实例掩码,每个持久对象查询在所有观察结果中绑定一个实体。该表示支持与提示无关的分割以及点和框条件选择,而不需要种子掩码或时间排序。我们进一步开发了 Agentic Harness,用于 4D 场景的大型观察空间中的自然语言基础。主动树搜索识别相关帧,无需扫描每个固定窗口;双流grounder通过互补的边界框预测和对象查询匹配,将细粒度的VLM视觉先验与几何一致的实例特征结合起来;独立评论家从他们的预测中选择最终的 4D 实例掩模。大量实验证明了在跨越静态和动态场景的统一评估下最先进的 4D 实例分割和强大的语言引导基础性能。