论文

利用 MLLM 的目标知识实现稳健的少样本分割

Exploiting Target Knowledge from MLLMs for Robust Few-Shot Segmentation

应用与实践视觉感知与空间理解

摘要

少镜头分割(FSS)旨在用少量(例如,一到五个)标记示例来分割看不见的对象类别,从而能够有效地适应新的类别。传统模型通常依赖于支持图像和查询图像之间基于外观的视觉匹配来进行分割。虽然简单,但由于目标知识不足,这些方法通常难以处理查询图像中的显着外观差异和遮挡。为了缓解这个问题,我们引入了一种新颖的框架,该框架利用多模态大型语言模型(MLLM)的强大推理能力来挖掘目标知识,并利用它来增强 FSS。具体来说,在 SAM 2 的基础上,我们的方法名为 MK-FSS,利用用于 FSS 的 MLLM 从查询图像派生的两种形式的互补知识,包括空间知识(提供指示潜在目标位置的空间先验)和语义知识(使用文本描述目标)。空间知识首先被编码成记忆表示,然后通过精心设计的双记忆辩论融合(DMDF)模块将所得记忆与查询图像中的支持引导记忆特征集成,产生更鲁棒的目标记忆特征。同时,语义知识被编码到文本特征中,文本特征通过渐进式跨模态提示生成器(PCPG)与多尺度查询特征融合,产生用于分割的目标感知多模态提示。双内存功能和多模式提示协同工作,提供目标的全面表示,从而实现更稳健的分割。在我们广泛的实验中,MK-FSS 显示了有希望的结果,并且很大程度上超越了现有的方法。代码将被发布。