论文

PR-MaGIC:通过掩模解码器梯度流进行即时细化以进行上下文分割

PR-MaGIC: Prompt Refinement Via Mask Decoder Gradient Flow For In-Context Segmentation

应用与实践视觉感知与空间理解

摘要

Segment Anything Model (SAM) 等视觉基础模型 (VFM) 显着促进了图像分割的广泛应用。然而,SAM 及其变体需要大量的手动工作来快速生成以及针对特定应用程序的额外训练。最近的方法通过将 SAM 集成到上下文(一个/几个镜头)分割中来解决这些限制,从而通过查询和支持图像之间的语义对齐实现自动提示。尽管做出了这些努力,但由于支持图像和查询图像之间的视觉不一致,它们仍然会生成次优提示,从而降低分割质量。为了解决这一限制,我们引入了 PR-MaGIC(通过掩模解码器梯度流进行上下文分割的提示细化),这是一个 无需训练 测试时框架,可通过源自 SAM 掩模解码器的梯度流细化提示。 PR-MaGIC 无缝集成到上下文分割框架中,通过简单的 top-1 选择策略在理论上有基础,但实际上稳定,确保跨样本的稳健性能。广泛的评估表明,PR-MaGIC 能够持续提高各种基准的分割质量,有效地缓解提示不足的问题,而无需额外的训练或架构修改。