论文

K12-KGraph:用于基准测试和训练的与课程一致的知识图 教育 LLM

K12-KGraph: A Curriculum-Aligned Knowledge Graph for Benchmarking and Training Educational LLMs

模型评测基准与评测资源

摘要

大语言模型 在 K-12 教育中越来越多地使用,但现有基准主要测试考试问答,而不是理解课程知识的结构和视觉呈现方式。我们将这种能力称为课程认知。它涵盖先决条件链、概念分类、实验概念链接、教学排序和视觉基础。我们推出了 K12-KGraph,这是一个从人民教育出版社官方小学、初中和高中数学、物理、化学和生物教科书中提取的与课程一致的知识图谱。它包含九种节点类型和十四种关系类型,涵盖课程结构和视觉基础。从该图中,我们得出了 K12-Bench,这是一个包含 23,640 个问题的多选基准测试,具有五个任务系列:Ground、Prereq、Neighbor、Evidence 和 Locate。我们还构建了 K12-Train,这是一个包含 7,335 个样本的图形引导监督 微调 语料库,其中包括 2,267 个纯文本 QA 对和 5,068 个多模态 VQA 对。在 K12-Bench 上,Gemini-3-Flash 仅实现 57% 的精确匹配,Gemma-4-31B-IT 达到 46%,其中 Prereq 和 Neighbor 是最难的任务。我们的训练实验表明,特定领域的监督可以缩小这种差距。在匹配的 2,300 个样本预算下,K12-Train-Text 的性能始终优于 GaukaoBench 和 EduEval 上八个主流指令调优语料库的同等大小的子集。对于视觉语言模型,尽管使用的样本少于完整的 DataFlow 和 WizardLM 基线,但在所有比较的训练配置中,K12-Train-Full 在 Gaukao-MM、MDK12-medium 和 K12Vista 上实现了最佳总体结果。它还超越了纯文本和纯多模式变体,表明文本和视觉监督是互补的。我们发布图表、基准、训练数据和完整的构建管道。