PixCon:用于基础模型半监督分割的干净正对比学习
PixCon: Clean-Positive Contrastive Learning for Foundation-Model Semi-Supervised Segmentation
摘要
半监督语义分割(SSSS)长期以来一直致力于解决一个问题,即哪些伪标签值得信任,并通过更加仔细的置信度过滤来回答这个问题。基金会主干改变了这一制度:对于 DINOv2 教师,严格的阈值已经保留了测量到的 98% 干净的伪标签集,因此保留的准确性不在于过滤器,而在于如何按类别构建嵌入空间。我们提出 PixCon,一个干净的正像素对比框架。 PixCon 维护一个每类记忆库,只接受学生已经正确分类的标记像素,通过构建保证无污染的正集 ($ρ_F=0$),这与之前从置信度过滤的伪标签构建的对比 SSSS 库(ReCo、U$^2$PL)不同。它是一致性主干上的单个分支,不添加推理时间参数,并且不需要银行特定的阈值。对监督 InfoNCE 梯度的一阶分析解释了为什么污染会造成伤害:它的假阳性项缩放为 $ρ_F/(1-ρ_F)$,我们测量(Pascal 上为 0.018,ADE20K 上为 0.106)而不是假设。在 Pascal VOC、Cityscapes 和 ADE20K 中,PixCon 在计算匹配的单开关协议中匹配或改进了基于 DINOv2 的强大 UniMatch V2 基线:它改进了每个 Pascal-1/8 种子(每种子增益约为 +0.2 mIoU),并且其三种子平均值达到 87.90(已发布的 UniMatch V2-B 数据)。由于在基础模型教师中污染已经很少见,我们的分析表明 $ρ_F=0$ 保证主要在教师削弱时起到鲁棒性的作用,而准确性的增益来自更清洁的积极监督,使清洁积极对比成为基础模型 SSSS 的稳健、低成本默认值。