论文
LaViSA:语言和视觉结构歧义基准
LaViSA: A Language and Vision Structural Ambiguity Benchmark
摘要
当单个句子因其句法结构而接受多种有效解释时,就会出现结构歧义,这对语言理解构成了根本性挑战。视觉场景可以作为解决此类歧义的有用线索,并且视觉和语言模型(VLM)需要能够从视觉场景中导出可能的语义解释。我们引入了语言和视觉结构模糊性 (LaViSA),这是一个旨在评估 VLM 利用视觉场景解决结构模糊性的能力的基准。 LaViSA 由歧义句子、其消歧句子以及这些消歧句子在七个歧义类别中的对应图像组成。使用 LaViSA,我们对各种 VLM 进行了全面评估,包括具有不同参数规模和推理能力的专有和开源模型。实验结果表明,尽管最近的 VLM 可以在一定程度上利用视觉场景来解决结构歧义,但它们仍然难以解决某些歧义类型和视觉上微妙的语义区别,这表明使用视觉场景解决结构歧义仍然存在局限性。