论文
TMI:文本到图像与图像到图像的互补数据合成,以促进长尾实例分割
TMI: Text-to-Image Meets Image-to-Image for Complementary Data Synthesis to Boost Long-Tailed Instance Segmentation
摘要
大词汇量实例分割受到长尾类别分布和细粒度类间模糊性的限制。虽然数据合成提供了一种有前途的替代方案,但当前的范式具有互补的局限性:文本到图像(T2I)方法继承了嘈杂的伪标签,并且在稀有类别上遇到困难,而复制粘贴方法则损害了上下文的真实性。为了解决这些问题,我们提出了一种将 T2I 生成与上下文感知图像到图像 (I2I) 编辑相结合的混合管道。 T2I分支提供广泛的类别和场景多样性,而师生方案通过有选择地仅保留提示指定的类别来确保标签的可靠性。为了加强对稀有类别的监督,我们引入了 VRAIN(通过指令编辑验证的稀有类别增强),这是一种新颖的 I2I 编辑器。 VRAIN 在野外场景中语义上适当的位置插入高置信度实例,产生语义连贯和视觉自然的编辑,从而减少域间隙并实现有针对性的增强。在 LVIS 基准上,我们的方法超越了现有基线,将整体 AP 提高了高达 +4.0 点,将稀有级 AP 提高了高达 +9.5 点,同时有效地扩展了骨干容量。我们的项目页面位于 https://seokhunchoi.github.io/TMI