论文
CLIP-Guided SAM:用于快速分割的参数高效语义调节
CLIP-Guided SAM: Parameter-Efficient Semantic Conditioning for Promptable Segmentation
摘要
诸如分段任意模型 (SAM) 之类的提示基础模型可以生成高质量的掩模,但在语义上仍然是盲目的,依赖于外部提示来指定类别。现有的视觉语言方法通过使用外部提示耦合来解决这一限制,其中视觉语言模型作为单独的阶段为 SAM 生成空间提示。我们提出了 CLIP-Guided SAM,这是一种基于内部语义调节的参数高效分割框架。我们不是仅使用语义信号来生成提示,而是通过轻量级多模态语义适配器将 CLIP 派生的文本、视觉和相似性特征直接注入 SAM 的图像编码器。这些适配器调节 SAM 的内部特征表示,允许语义信息影响掩模预测,同时保留 SAM 原始的提示界面。我们的框架专为低标记数据设置而设计,适用于通用领域基准测试和专门的下游任务。它支持两种操作模式:手动模式,用于具有文本和空间提示的交互式分割;半自动纯文本模式,用于需要仅使用文本输入进行特定概念分割的应用程序。我们表明,鲁棒性取决于训练与推理中使用的提示类型的一致性,使训练-测试提示的一致性成为一个重要的设计原则。通过广泛的实验和消融,我们根据 SAM+PEFT 基线评估我们的方法,无需语义条件、视觉语言 + SAM 管道、SAM 3 以及依赖大量未标记数据的强大半监督分割方法。在这些设置中,CLIP-Guided SAM 始终如一地实现卓越或有竞争力的性能,同时在训练和部署中保持参数高效。