论文

视觉语言基础作为双向概念对应

Vision-Language Grounding as Bidirectional Concept Correspondence

应用与实践视觉感知与空间理解

摘要

视觉语言基础将语言与视觉内容联系起来,但大多数现有的表述将基础简化为单向定位问题:给定预先指定的文本短语或类别名称,识别相应的图像区域。这种设置假设相关的语言单位是已知的,忽略了基础交流中更基本的挑战:确定文本的哪些部分具有视觉参考性以及它们如何与图像中的实体相对应。我们将基础表述为图像文本对上的$\textit{双向概念对应}$。给定图像及其配对文本,目标是恢复视觉参考文本范围和实例级图像片段之间的所有对应关系,而不假设提供了相关文本范围。该公式通过将文本分割、图像分割和跨模态对齐视为单个对应预测问题,统一了常见的基础任务,包括短语基础、指称表达基础和开放词汇检测。为了解决这个任务,我们引入了 $\textbf{ConCor-1}$,这是一个建立在预训练视觉语言模型之上的基础模型。它使用可学习的 $\textit{bridge tokens}$ 来表示候选图像-文本对应关系,并为每个标记预测文本掩码、图像掩码和对应存在分数。为了训练和评估这项任务,我们将不同的基础和分割数据集转换为统一的对应格式。实验表明,$\textbf{ConCor-1}$ 始终优于基线,在长标题数据集上将对应 F1 提高了 48%,在零样本 LVIS 上将对应 F1 提高了 29%,其中大类别列表用作文本输入。