论文
KMMMU:韩国语言和语境中大规模多学科多模态理解的评估
KMMMU: Evaluation of Massive Multi-discipline Multimodal Understanding in Korean Language and Context
摘要
我们引入 KMMMU,这是一个韩国本土基准,用于评估韩国文化和制度环境中的多模式理解。 KMMMU 包含 3,466 个问题,来自用韩语编写的考试,涵盖 9 个学科和 9 个视觉形态类别,以及 300 项韩语特定子集和 627 个问题的硬子集。与翻译或以英语为中心的基准不同,KMMMU 的目标是由当地惯例、官方标准和特定学科的视觉格式形成的信息密集型问题。实验表明,最强的开源模型在全集上仅达到 42.05% 的准确率,而最好的专有模型在硬子集上达到 52.42% 的准确率。不同学科的表现各不相同,一些学科出现了瓶颈,韩国特有的问题显示出高达 13.43% 的差距。错误分析表明,这些失败与其说是因为推理深度不足,不如说是因为约定到标签的映射、小样本符号归纳、本地化知识回忆和特定领域标准理解薄弱。 KMMMU 提供了一个测试平台,用于超越以英语为中心的基准的多模式评估,并为专家现实世界任务开发更可靠的系统。