论文

无需 logits 的直接分段 无需训练 开放词汇语义分段的优化

Direct Segmentation without Logits Optimization for Training-Free Open-Vocabulary Semantic Segmentation

应用与实践视觉感知与空间理解

摘要

开放词汇语义分割(OVSS)旨在使用开放词汇提示分割图像中的任意类别区域,这要求现有方法具有像素级视觉语言对齐能力。通常,此功能涉及计算视觉和语言特征之间的余弦相似度,即 logits,并最小化 logits 和 真值 (GT) 之间的分布差异,以生成随后用于构建分割图的最佳 logits,但这取决于耗时的迭代训练或特定于模型的注意力调制。在这项工作中,我们提出了一种更直接的方法,通过直接导出分割图的分析解决方案来避开 logits 优化过程。我们提出一个关键假设:分布差异编码语义信息;具体来说,这种差异表现出属于同一类别的补丁之间的一致性,但不同类别之间的不一致。基于这个假设,我们直接利用这种分布差异的解析解作为语义图。换句话说,我们将分布差异的优化重新表述为推导其分析解决方案,从而消除了耗时的迭代训练,使我们摆脱了特定于模型的注意力调制,并在八个基准数据集上实现了最先进的性能。