论文
LASA:开放词汇场景草图语义分割的弱监督方法
LASA: A Weak Supervision Method for Open-Vocabulary Scene Sketch Semantic Segmentation
摘要
开放词汇场景草图语义分割旨在基于推理时指定的灵活类别词汇为稀疏线条图分配密集的语义标签,而不依赖于训练期间的像素级注释。与自然图像不同,草图缺乏纹理和颜色提示,使得语义理解严重依赖于笔画布局和空间配置,这是一个挑战,使得单层视觉语言特征本质上不稳定。我们的主要观察结果是,来自不同 Vision Transformer 层的注意力图编码了互补的空间线索:浅层捕获全局结构布局,而更深的层则关注局部笔画交叉点和对象部分。这表明跨层聚合提供了比任何单独层更强大的结构先验。利用这一见解,我们提出了一种基于 \textbf{L}ayer-wise \textbf{A}cumulated \textbf{S}structural \textbf{A}ttention (\textbf{LASA}) 的结构感知框架,该框架聚合多层注意力,以指导弱监督下的分层语义对齐,并在推理过程中细化预测。在 FS-COCO、SFSD 和 FrISS 上的实验表明,与之前的弱监督基线相比,LASA 将 mIoU 提高了 $+3.43$、$+8.01$ 和 $+15.74$,证明了分割精度和空间一致性方面的一致增益。我们的源代码将公开。