论文

来自日本国家学术能力评估的 90 万规模学生综合反应分布的人性化多模式基准

Human-Grounded Multimodal Benchmark with 900K-Scale Aggregated Student Response Distributions from Japan's National Assessment of Academic Ability

模型评测基准与评测资源

摘要

真实的学校考试为评估多模式 大语言模型 (MLLM) 提供了高有效性的测试平台,但基于日本 K-12 评估的基准仍然很少。我们提出了一个根据日本国家学术能力评估构建的多模态数据集,其中包括正式发布的科学、数学和日语方面的中学项目。与基于合成或整理数据的现有基准不同,我们的数据集保留了真实的考试布局、图表和日语教育文本,以及全国汇总的学生反应分布(N $\approx$ 900{,}000)。这些功能可以在统一的评估框架下直接比较人类和模型的表现。我们使用精确匹配精度和字符级 F1 进行开放式响应,对最近的多模态 LLM 进行基准测试,观察受试者之间的实质性差异以及对视觉推理需求的高度敏感性。人工评估和 LLM 作为评判分析进一步评估自动评分的可靠性。我们的数据集为多模式教育推理建立了一个可重复的、以人为本的基准,并支持未来在真实评估环境中进行评估、反馈生成和可解释人工智能的研究。我们的数据集位于:https://github.com/KyosukeTakami/gakucho-benchmark