论文

超越指称表达:情景理解视觉基础

Beyond Referring Expressions: Scenario Comprehension Visual Grounding

模型评测基准与评测资源

摘要

现有的视觉基础基准主要评估图像区域和文字引用表达式之间的对齐,其中模型通常可以通过匹配突出的命名类别来成功。我们探索基于场景的视觉基础的互补且更具挑战性的设置,其中目标必须从角色、意图和关系上下文而不是明确的命名中推断出来。我们引入了参考场景理解 (RSC),这是专为此设置而设计的基准。此基准测试中的查询是描述对象角色、用户目标和上下文线索的段落长度文本,包括对通常需要深入理解才能解决的干扰对象的故意引用。每个实例都用可解释的难度标签进行注释,以显示独特性、混乱、大小、重叠和位置,从而暴露不同的故障模式并支持细粒度分析。 RSC 包含大约 31k 个训练示例、4k 个域内测试示例以及 3k 个未见过的对象类别的分布外分割。我们进一步提出了 ScenGround,一种课程推理方法,作为此设置的参考点,将监督热启动与难度感知强化学习相结合。实验表明,基于场景的查询暴露了当前模型中标准基准未揭示的系统性故障,并且课程训练提高了具有挑战性的切片的性能并转移到标准基准。