论文

无需训练 通过开放词汇语义仲裁的广义少样本分割

Training-Free Generalized Few-Shot Segmentation through Open-Vocabulary Semantic Arbitration

应用与实践视觉感知与空间理解

摘要

广义少样本语义分割(GFSS)传统上被视为表示学习问题,需要针对特定​​任务进行调整,以合并来自有限支持示例的新类。然而,最近的基础模型已经表现出强大的开放词汇识别和分割能力,从而提出了一个不同的问题:GFSS 是否可以通过冻结语义先验的推理时间协调而不是参数适应来解决?我们使用 Open-V 回答这个问题,这是一个 无需训练 GFSS 框架,通过校准的每像素语义仲裁,将 Segment Anything (SAM3) 提示概念分割 (PCS) 与 K-shot CLIP 支持质心相结合。 OpenV 不引入可训练组件,并且在推理时支持任意语义类别。除了细分性能之外,我们的研究还提供了三个更广泛的发现。首先,我们表明支持信息可以通过推理时语义基础合并,并且随着基础模型文本先验在标签不相交词汇上的削弱,其贡献会增加。其次,我们确定了基础模型分割中的可重复性混淆,证明预处理和评估空间不匹配可能会默默地扭曲报告的性能。最后,我们在 PASCAL5i、COCO-20i 和 ADE-OW 上验证 Open-V,表明基础模型先验的 无需训练 协调可以在传统 GFSS 和开放词汇评估设置中推广。在 PASCAL-5i(1-shot)上,Open-V 达到了 78.4/77.5/77.9 的基本/新颖/谐波 mIoU,无需 GFSS 特定训练,超过最强训练基线 +17.7 HM。