论文
Jako Tako 还是 Fluent?介绍 PoVisLE:波兰视觉语言评估
Jako Tako or Fluent? Presenting PoVisLE: A Polish Vision-Language Evaluation
摘要
视觉语言模型 (VLM) 在图像字幕、视觉问答和图像到文本生成等任务上取得了出色的性能。然而,他们主要接受以英语为中心的数据训练,这限制了他们处理基于文化的视觉理解的能力,并导致他们无法解释特定区域的含义、符号内容和上下文相关的视觉线索。现有的文化能力基准通常是模板驱动的,并且侧重于表面识别,这使得它们不足以评估文化情境中更深层的语言和语用理解。我们引入了 PoVisLE,这是一种针对波兰语的单一文化视觉语言基准,旨在在扎根的评估范式下评估基于文化的多模态理解,其中语言是在与视觉上下文的交互中进行解释的。该数据集包含 1,117 张图像和 2,366 个手动注释的 VQA 对。总的来说,我们的数据集提供了一个受控且具有挑战性的资源,用于评估超越表面识别的基于文化的视觉语言理解。