论文
WikiVQABench:来自维基百科和维基数据的基于知识的视觉问答基准
WikiVQABench: A Knowledge-Grounded Visual Question Answering Benchmark from Wikipedia and Wikidata
摘要
视觉问答(VQA)基准在很大程度上强调基于感知的任务,这些任务可以仅通过视觉内容来解决。相比之下,许多现实世界的场景需要无法在图像中直接观察到的外部知识才能正确回答。我们介绍 WikiVQABench,这是一个人工策划的基于知识的 VQA 基准,通过系统地结合维基百科图像、其相关文章标题和来自维基数据的结构化知识而构建。我们的管道使用 大语言模型 (LLM) 生成候选多项选择图像问题答案集。所有生成的实例随后都由人工注释者进行审查和管理,以确保事实正确性、视觉文本一致性,并且每个问题除了视觉证据之外还需要外部知识才能正确解决。 WikiVQABench 包含大量维基百科图像,其中包含精选的多项选择问题,旨在对知识感知视觉语言模型 (VLM) 进行基准测试。对 15 个 VLM(256M-90B 参数)的评估揭示了广泛的性能范围(24.7%-75.6% 准确度),表明该基准有效区分了知识密集型推理的模型能力。数据集和基准测试代码是公开的。