论文

JAMMEval:日本可靠 VLM 评估基准的精炼集合

JAMMEval: A Refined Collection of Japanese Benchmarks for Reliable VLM Evaluation

模型评测基准与评测资源

摘要

可靠的评估对于视觉语言模型(VLM)的开发至关重要。然而,日本 VQA 基准的迭代细化程度远低于英国同行。因此,许多现有的基准测试存在问题模糊、答案不正确以及无需视觉基础即可解决的实例等问题,从而损害了评估的可靠性并导致模型比较中得出误导性的结论。为了解决这些限制,我们引入了 JAMMEval,这是用于可靠 VLM 评估的日本基准的精炼集合。它是通过两轮人工注释系统地完善七个现有的日本基准数据集而构建的,提高了数据质量和评估可靠性。在我们的实验中,我们在 JAMMEval 上评估开放权重和专有 VLM,并分析日本 VQA 上最新模型的功能。我们进一步证明了我们的改进的有效性,结果表明,所得到的基准产生的评估分数可以更好地反映模型能力,表现出较低的运行间方差,并提高区分不同能力水平的模型的能力。我们发布数据集和代码以推进 VLM 的可靠评估。