论文

TIPSv2:通过增强的补丁文本对齐推进视觉语言预训练

TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment

模型训练预训练

摘要

视觉语言预训练的最新进展使许多下游计算机视觉应用程序得到了显着改进,例如分类、检索、分割和深度预测。然而,这些模型仍然难以解决的一个基本能力是将密集补丁表示与相应概念的文本嵌入对齐。在这项工作中,我们研究了这个关键问题,并提出了新技术来增强基础视觉语言模型的这种能力。首先,我们揭示了补丁级别的 蒸馏 过程显着增强了密集的补丁文本对齐——令人惊讶的是,经过蒸馏的学生模型的补丁文本对齐远远超过了教师模型。这一观察结果启发我们考虑修改预训练方案,促使我们提出 iBOT++,这是对常用 iBOT 掩模图像目标的升级,其中未掩模的标记也直接导致损失。这极大地增强了预训练模型的补丁文本对齐。此外,为了提高视觉语言预训练的效率和有效性,我们修改了学习方案中的指数移动平均设置,并引入了图像描述采样策略,以从不同粒度的合成图像描述中受益。结合这些组件,我们开发了 TIPSv2,这是一个新的图像文本编码器模型系列,适用于广泛的下游应用。通过对 9 个任务和 20 个数据集的综合实验,我们展示了强大的性能,通常与最新的视觉编码器模型相当或更好。代码和模型通过我们的项目页面发布:https://gdm-tipsv2.github.io/。