论文

文本到种子生成:无需训练 开放词汇种子语义分割,通过重新利用扩散作为文本引导种子生成器

Text-to-seed generation: Training-free open-vocabulary seeded semantic segmentation via re-purposing diffusion as text-guided seed generator

应用与实践视觉感知与空间理解

摘要

开放词汇语义分割(OVSS)旨在分割与任意文本查询相对应的图像区域。尽管分段任意模型 (SAM) 是强大的分段基础模型,但其在 OVSS 上的独立性能仍然有限。因此,现有方法经常使用 SAM 来细化其他模型预测的粗略掩模,但当初始掩模不准确时,这种策略是不可靠的。在这项工作中,我们认为,通过利用 SAM 作为由准确的对象点(即种子)而不是不准确的粗掩模引导的区域扩展模块,可以实现更可靠的分割。受经典种子分割的启发,我们将 OVSS 重新表述为文本引导的种子定位,然后是基于种子的区域扩展。为了实现这个想法,我们提出了文本到种子(T2S),这是一个 无需训练 框架,它利用稳定扩散的文本到区域对应关系,为文本描述的目标类别生成基于注意力的种子点。然后,这些稀疏种子将用作 SAM 的点提示,以生成完整的对象蒙版。无需特定于任务的训练或额外注释,T2S 在标准 OVSS 基准上实现了强大的性能,证明了将语义基础与种子驱动的空间分割相结合的有效性。