论文

SciEval:K-12科学教学材料自动评估基准

SciEval: A Benchmark for Automatic Evaluation of K-12 Science Instructional Materials

模型评测基准与评测资源

摘要

随着越来越多教育工作者使用生成式AI创建教学材料,评估K-12科学教育教学材料的需求日益重要。然而,教学材料评审耗时、高度依赖专业知识且难以规模化,激发了对自动评估方法的兴趣。尽管大语言模型(LLM)在通用评估任务上表现出色,其在教学材料上的表现与可靠性仍不清楚。为填补这一空白,我们将教学材料自动评估(Automatic Instructional Materials Evaluation, AIME)形式化为一个生成式AI任务:依据教育者设计的量规预测分数与证据。我们为AIME创建了基准数据集并开发基线模型。首先,我们整理了首个AIME数据集SciEval,由带有符合教学法的评估分数与基于证据的理由标注的教学材料组成。专家标注达到高评分者间信度,最终得到的数据集包含273份课时级教学材料,采用EQuIP量规按13项标准评估(N=3549)。其次,我们在SciEval上测试主流LLM(GPT、Gemini、Llama与Qwen),发现没有一个取得强劲表现。随后我们在SciEval上微调Qwen3。在留出测试集上的结果显示,与领域对齐的微调可带来高达11个百分点的性能提升,凸显了领域专属微调对AIME的重要性,并有助于LLM在其他教育任务中的应用。

SciEval:K-12科学教学材料自动评估基准:论文配图
图1:左侧概括EQuIP量规标准,右侧展示对应课程组件,说明量规标准如何与K-12科学教材内容对齐以支持自动评估。