论文

InstAP:用于时空理解的实例感知视觉语言预训练

InstAP: Instance-Aware Vision-Language Pre-Train for Spatial-Temporal Understanding

模型训练预训练

摘要

当前的视觉语言 预训练 (VLP) 范例在全局场景理解方面表现出色,但由于仅限全局监督,因此在实例级推理方面遇到困难。我们引入了 InstAP,这是一个实例感知 预训练 框架,它通过将文本提及基于特定的时空区域来联合优化全局视觉文本对齐和细粒度的实例级对比对齐。为了支持这一点,我们提出了 InstVL,这是一个具有双粒度注释的大型数据集(200 万张图像、50,000 个视频):整体场景描述和密集且具有定位信息的实例描述。在 InstVL 基准上,InstAP 在实例级检索方面大大优于现有的 VLP 模型,并且也超过了在完全相同的数据语料库上训练的强大 VLP 基线,从而隔离了我们实例感知目标的优势。此外,以实例为中心的 预训练 提高了全球理解:InstAP 在多个视频基准上实现了具有竞争力的零镜头性能,包括 MSR-VTT 和 DiDeMo。定性可视化进一步表明,InstAP 将文本提及定位到正确的实例,而仅全局模型表现出更分散的场景级注意力。