论文

HNC:利用硬否定字幕构建具有细粒度视觉语言理解能力的模型

HNC: Leveraging Hard Negative Captions towards Models with Fine-Grained Visual-Linguistic Comprehension Capabilities

模型训练合成数据

摘要

图像文本匹配(ITM)是从视觉和语言(VL)的大型语料库中学习广义表示的事实上的方法之一。然而,由于网络收集的图像-文本对之间的关​​联较弱,模型无法显示出对这些模态的组合语义的细粒度理解。为了解决这个问题,我们提出了硬否定字幕(HNC):一个自动创建的数据集,其中包含用于 ITM 训练的挫败的硬否定字幕,以实现 VL 中的细粒度跨模态理解。此外,我们还提供了一个具有挑战性的手动创建的测试集,用于对具有不同组合复杂程度的细粒度跨模式失配任务的模型进行基准测试。我们的结果表明,通过提高模型检测诊断任务不匹配的零样本能力以及在嘈杂的视觉输入场景下稳健执行,HNC 训练的有效性。此外,我们还证明 HNC 模型可以为 微调 产生类似或更好的初始化