论文

SynCLIP:同义词一致的语言图像预训练,增强开放词汇密集感知

SynCLIP: Synonym-Coherent Language-Image Pretraining for Robust Open-Vocabulary Dense Perception

模型训练预训练

摘要

开放词汇密集感知借助文本知识定位训练中未见的物体。论文发现CLIP方法存在同义词引发的定位不一致:语义等价表达可能产生不同空间注意力,削弱实际应用的鲁棒性。为此,作者提出同义词一致的语言图像预训练框架SynCLIP。语义一致空间注意力对齐SSA模块最小化原始和同义表达注意力图的差异;空间注意力细化SAR模块进一步强化图中最相关的区域,使定位更精确稳定。 论文还构建SEViC语料,为每个类别增加多个同义词和文本定义。多个基准的实验显示,SynCLIP改善不同语言表达下的定位一致性,并在所比较的CLIP开放词汇密集感知方法中取得最优表现。代码见https://github.com/Justlovesmile/SynCLIP。