论文
JMed48k:用于视觉语言模型评估的多专业日本医疗许可基准
JMed48k: A Multi-Profession Japanese Medical Licensing Benchmark for Vision-Language Model Evaluation
摘要
我们推出 JMed48k,这是一种用于评估视觉语言模型的多专业日本医疗保健许可基准。 JMed48k 以日本厚生劳动省发布的官方 PDF 材料为基础,包含 2005 年至 2025 年间 11 次国家执照考试的 48,862 道考试题和 20,142 张图像,并根据 8 类分类法注释了视觉内容。从这个语料库中,我们得出了 JMed48k-Eval,这是一个最近五年的评估子集,包含 12,484 个评分问题,其中包括 9,905 个纯文本问题和 2,579 个带有图像的问题。我们评估了 21 个专有、开源和医疗专用模型,分别报告纯文本和带图像的性能。由于这些子集包含不同的问题,因此我们进一步引入了配对图像删除审核,该审计在删除视觉内容之前和之后使用图像评估问题,以探索四种答案转换状态。审计表明,专有和开源模型从图像中获益匪浅,而医疗专用系统显示出对视觉证据的可观察使用有限,许多正确答案在图像删除后仍然存在。即使在专有模型中,不同专业的净图像去除效果也有七倍的差异,从医生问题的+5.7分到公共卫生护士问题的+39.8分。我们发布 JMed48k 来支持医疗许可环境中视觉语言模型的可重复、专业分层评估。