论文

用于细粒度开放词汇分割的分解视觉语言对齐

Decomposed Vision-Language Alignment for Fine-Grained Open-Vocabulary Segmentation

模型架构Transformer

摘要

开放词汇分割模型通常很难推广到对象类别和属性的看不见的组合,因为细粒度的描述通常被编码为纠缠多个语义单元的整体句子。我们提出了一个分解的视觉语言对齐框架,该框架将文本提示显式分解为概念标记和多个属性标记,从而为每个语义单元实现单独的跨模式交互。在特征层面,我们引入了特征门控交叉注意力模块,该模块生成特定于属性的门控图,以乘法方式融合信息,有效地强化组合语义。在评分级别,每个标记的相似性在日志空间中聚合,产生稳定且可解释的组合匹配。该方法可以无缝集成到现有的基于 Transformer 的分割架构中,并显着提高细粒度开放词汇分割基准中未见属性类别组合的泛化能力。