论文

PrAda:用于文本提示分割的少镜头视觉适应

PrAda: Few-Shot Visual Adaptation for Text-Prompted Segmentation

模型训练参数高效训练

摘要

分割图像对于视觉理解至关重要,但需要大量的像素级注释。基础模型启用了新的范式,可以在文本提示的指导下预测新类别,而无需来自目标域的注释。然而,在远离原始 预训练 的专门目标域上,它们的性能会下降。我们研究了这种领域转移下现有方法的错误,发现错误分类而不是掩模生成是罪魁祸首。为了解决这个问题,我们引入了用于文本提示分割的少镜头视觉适应的新问题。这种适应已经在图像分类中得到了大量研究,但在分割方面仍有待探索。我们使用原型适应(PrAda)来解决这个任务,这是一种新颖的、参数高效的方法,可以适应冻结的文本提示分割模型。我们的方法通过结合细粒度像素特征和高级 Transformer 表示来学习特定于类的原型,然后通过学习的重要性因子将其与基于原始文本的预测融合。这保留了模型的零样本潜力,同时能够强大地适应新领域。在五个基准上进行的语义、实例和全景分割实验表明,PrAda 比最先进的和建议的基线有了显着的改进。