论文

具有自注释区域对齐功能的细粒度 CLIP 微调

Fine-grained CLIP fine-tuning with self-annotated region alignment

模型训练监督微调与指令调优

摘要

对比语言图像 预训练 (CLIP) 已被证明在其细粒度密集特征表示方面存在局限性,因为它的 预训练 专注于将整个图像与文本描述进行匹配。考虑到 预训练(从头开始的视觉语言模型)的大数据和计算负担,一系列工作旨在通过 微调 方案增强 CLIP 的细粒度能力。然而,现有的工作受到各种限制:通常需要额外的区域注释,这限制了由于预定义类别而导致的语义多样性,并导致处理训练数据的大量工作;他们通常会牺牲 CLIP 原有的全局视觉表示能力。为了绕过这些限制,我们提出了SFF-CLIP(Self-annotated Fine-grained 微调 for CLIP),它仅使用图像文本对作为输入来增强CLIP 微调中的细粒度表示能力,同时保持全局视觉语义一致性。具体而言,设计了一种运行时区域短语对齐方案,该方案从输入句子中获取概念短语,并使用特定于文本的热图将它们与相应提取的基于区域的特征对齐。大量实验表明,SFF-CLIP 可以显着提高细粒度密集特征表示的性能,并保持原始 CLIP 在图像级任务上的性能。代码稍后发布。