论文

用于垃圾分类语义分割中无监督域适应的视觉语言引导伪标签

Vision-Language-Guided Pseudo-Labels for Unsupervised Domain Adaptation in Semantic Segmentation for Waste Sorting

模型训练合成数据

摘要

在应用环境(例如自动驾驶、工业废物分类)中获取用于语义分割的标记数据非常昂贵,而且通常无法大规模实施。我们提出了一种跨模式伪标记管道,可以在没有任何目标域注释的情况下实现无监督域适应。该管道建立在两个核心基础模型之上:SAM 生成与类别无关的区域建议,EVA-CLIP 根据区域文本相似性分配语义标签,并通过置信过滤确保仅使用可靠的伪标签来自训练分割模型。作为可选扩展,BLIP 为模糊区域提供基于语言的验证,从而在不改变整体管道的情况下提高伪标签质量。经过对两个领域转变的评估,从合成到真实的自动驾驶,以及主要关注的实验室到工厂的工业废物分类,该管道持续改进,超过了仅来源的基线。我们的结果表明,伪标签的质量(而不是数量)是领域转移下自我训练的决定性因素,并且跨模式语言基础为部署关键型应用程序中可靠的自动注释提供了一条实用途径。