论文
Almieyar-Oryx-BloomBench:视觉语言模型认知知情评估的双语多模态基准
Almieyar-Oryx-BloomBench: A Bilingual Multimodal Benchmark for Cognitively Informed Evaluation of Vision-Language Models
摘要
尽管视觉语言模型 (VLM) 取得了快速进展,但该领域缺乏严格诊断其真实推理能力并绘制类人多模态智能有意义进展的基准。大多数现有的评估都集中在零碎或互不相关的任务上,掩盖了关键的认知弱点,并且几乎没有提供有针对性的改进的见解。为了解决这一差距,我们引入了 BloomBench,它是 Almieyar 基准测试系列的一部分,是第一个基于认知的人类双语(英语-阿拉伯语)多模态 VLM 基准测试。 BloomBench 以 Bloom 分类法为基础,通过精心设计的图像问答任务,系统地评估六个认知水平(记住、理解、应用、分析、评估、创造)。它采用半自动化管道构建,并通过分层混合质量保证协议进行验证,确保可扩展性、文化包容性和语言保真度。利用这个框架,我们对最先进的 VLM 进行了全面研究,以诊断他们的认知概况。我们的分析揭示了严重的认知不对称:虽然最先进的模型在语义理解方面实现了强大的性能上限,但它们在事实回忆和创造性合成方面却遇到了很大的困难。这表明当前的一般多模式熟练程度掩盖了特定认知层更深层次的限制。此外,我们的研究强调了阿拉伯语和英语之间的关键性能差距,暴露了当前跨语言多模态推理的局限性。这些发现为开发更具认知一致性和包容性的 VLM 奠定了基础。基准框架和数据集位于:https://github.com/qcri/Almieyar-Oryx-BloomBench。