论文
从多模态伪标签中学习以实现鲁棒的开放词汇实例和全景分割
Learning from Multimodal Pseudo-Labels for Robust Open-Vocabulary Instance and Panoptic Segmentation
摘要
这项工作解决了开放词汇实例分割(OVIS)和开放集全景分割(OSPS)的挑战,其目的是在没有详尽的人工注释的情况下识别预定义和不可见的对象类别。现有的方法经常受到嘈杂的伪掩模、有限的视觉文本基础以及处理同义词或词汇外(OOV)单词的困难的困扰。为了克服这些挑战,我们提出了一个多模态框架,该框架利用预先训练的视觉语言模型来自动生成伪标签、CLIP 引导的同义词过滤和基于 GPT 的标题重建。在我们的目标词汇辅助伪标签设置中,该框架首先使用 Grounded SAM、LLaVA 和 CLIP 构建伪分割掩码、描述性标题和语义对齐的同义词集,从而提供多模态监督,无需手动注释。然后,我们通过三个互补的训练目标来增强视觉文本对齐:包含视觉视觉文本对齐同义词的扩展视觉文本对齐损失、语义一致性损失和生成描述重建损失。对 COCO 数据集的大量实验表明,所提出的方法始终优于该协议下以前最先进的方法,在 OVIS 和 OSPS 基准上实现了实质性改进。