论文
FAST-GOAL:快速高效的全局-局部目标对齐学习
FAST-GOAL: Fast and Efficient Global-local Object Alignment Learning
摘要
CLIP等视觉-语言模型在对齐图像与文本方面展现出令人瞩目的能力,但由于在简短精炼的描述上预训练,它们常常难以处理冗长细致的文本描述。我们提出FAST-GOAL(快速高效全局-局部目标对齐学习),一种通过全局-局部语义对齐提升CLIP处理冗长文本能力的高效微调方法。我们的方法包含两个关键组件。第一,快速局部图文匹配(FLISM)通过目标检测与空间划分高效抽取局部图像区域,然后将其与相应句子匹配。第二,基于词元相似度的学习(TSL)最大化图像中特定区域的patch词元与其对应区域嵌入之间的相似度,并将同一原理应用于文本,从而增强模型捕捉细致对应关系的能力。此外,我们提出GLIT100k数据集,它同时提供全局的图像-冗长描述对与由上下文导出的局部对,其中局部描述从全局描述中抽取以保持语义连贯。通过在长描述数据集(DOCCI、DCI)与短描述数据集(MSCOCO、Flickr30k)上的大量实验,我们证明FAST-GOAL相对基线取得显著提升,使CLIP能有效适配细致的文本描述,同时保持计算效率。
