论文

少镜头概念通过视觉基础促进分割基础模型的学习

Few-Shot Concept Prompt Learning for Segmentation Foundation Models via Visual Grounding

模型训练参数高效训练

摘要

SAM3 和 Medical SAM3 等即时分割基础模型 (FM) 有望通过自然语言界面对医学成像进行少量、交互式指定的分割,但它们在临床任务上的表现却远远达不到这一承诺。我们认为,这种缺陷并不是医疗预训练不足或提示措辞不完善造成的,而是一种结构性限制,这种限制在任何缺乏配对图像文本监督的领域都会持续存在,就像大多数临床模式一样。我们进一步假设该限制特定于自然语言作为控制信号:直接从目标分布学习的基于视觉的提示应该可以恢复损失的性能,而无需额外的图像文本数据或主干再训练。我们提出了少样本概念提示学习(FS-CPL),它通过掩模监督从 $K$ 图像掩模对的小支持集中学习嵌入 $\mathbf{p}^* \in \mathbb{R}^{T \times d}$ 的连续概念提示,编码器-解码器主干冻结。在涵盖超声和内窥镜检查的四个公共基准(BUSI、HC18、TN3K、CVC-Clinic)中,FS-CPL 与规范文本提示相比,绝对 Dice 改进高达 $+0.62$,并且 \emph{backbone-agnostic}:它提升了普通 SAM3 和特定于领域的预训练医疗 SAM3,表明视觉概念提示与域内预训练是互补的。