论文
面向新型AI辅助教育问题教学评估的预训练模型评测
Evaluation of pre-trained models for pedagogical assessment of novel AI-assisted educational questions
摘要
AI辅助生成教育材料的浪潮已超出我们验证其教学质量的能力。使用Bloom分类器模型进行自动评估是一种大规模评估教育材料的有前景方法。这些模型在分布内(IID)数据集上表现出高准确率。然而,将同一模型应用于新的分布外(OOD)数据集(如AI辅助生成的问题)可能出现性能退化。为识别在数据集偏移下稳健的分类器,我们在Bloom层级分类任务上评测了传统机器学习(ML)、transformer与大语言模型。我们还探索了特征工程策略,包括纳入NLP指标、将学习目标附加为输入的一部分,以及文本拼接,以稳定OOD性能。基线测试显示,TFPOS-IDF ML模型在OOD上表现不佳(Macro F1为0.48),相比之下BERT为0.55、LLM为0.79。文本拼接提升了ML与BERT模型的Macro F1(分别为0.59和0.62)。将学习目标附加到输入提升了模型在特定数据集上的性能。模型再训练在所有模型和数据集上带来了最大提升。总体而言,这些发现凸显了在新型AI辅助教育问题上使用预训练模型的权衡,以及策略性特征增强如何帮助缓解性能损失。
