论文

弥补:假图像,广义少镜头语义分割的真正收获

Make It Up: Fake Images, Real Gains in Generalized Few-shot Semantic Segmentation

模型训练合成数据

摘要

广义少镜头语义分割(GFSS)从根本上受到稀缺注释下新颖类外观的覆盖范围的限制。虽然扩散模型可以大规模合成新颖的图像,但当掩模不可用或不可靠时,实际收益往往会因覆盖不足和嘈杂的监督而受到阻碍。我们提出了 Syn4Seg,这是一种一代增强型 GFSS 框架,旨在扩大新颖类别的覆盖范围,同时提高伪标签质量。 Syn4Seg 首先通过为每个新颖类别构建嵌入、重复数据删除的提示库来最大化提示空间覆盖范围,从而生成多样化但类别一致的合成图像。然后,它通过两阶段细化执行支持引导的伪标签估计,i)过滤低一致性区域以获得高精度种子,ii)使用结合了全局(支持)和局部(图像)统计数据的图像自适应原型重新标记不确定像素。最后,我们使用基于 SAM 的约束更新仅细化边界带和未标记像素,以提高轮廓保真度,而不会覆盖高置信度内部。 PASCAL-$5^i$ 和 COCO-$20^i$ 上的大量实验证明了 1-shot 和 5-shot 设置的一致改进,突出显示合成数据是 GFSS 的可扩展路径,具有可靠的掩模和精确的边界。