论文

像人类一样看待:从运动中学习在没有监督的情况下分割任何东西

Seeing as Humans Do: Learning from Motion to Segment Anything Without Supervision

模型训练预训练

摘要

分段任意模型 (SAM) 严重依赖大量手动注释,为模型扩展造成了根本瓶颈。虽然无监督方法试图从运动中学习对象概念,但它们通常过度适合移动实体,缺乏多粒度理解和泛化到静态对象的能力。为了克服这个问题,我们引入了 Motion-Grounded Segment Anything (MoSA),这是一种高度可扩展的无监督框架,可以从未标记的视频中先学习可转移的对象性。 MoSA 分为三个渐进阶段:(1)从大规模视频数据自动生成多粒度运动伪标签; (2)通过对比学习训练感知分组模型(PGM),以内化广义的、外观驱动的对象概念; (3) 将学到的先验知识转移到提示引导的架构中,以对图像进行分段任何类型的推理。对七个具有挑战性的基准(例如 COCO 和 ADE20K)进行的广泛的零样本评估表明,MoSA 的性能显着优于现有的无监督方法。值得注意的是,尽管使用零手动注释,MoSA 仍实现了与完全监督的 SAM 相当的分割性能。我们的研究结果表明,利用大规模未标记运动是注释驱动的分段任何管道的可行且高度可扩展的替代方案。