论文

GenAI-LA:生成人工智能和学习分析研讨会 (LAK 2026),2026 年 4 月 27 日至 5 月 1 日,挪威卑尔根

GenAI-LA: Generative AI and Learning Analytics Workshop (LAK 2026), April 27--May 1, 2026, Bergen, Norway

模型评测基准与评测资源

摘要

本工作提出 EduEVAL-DB,一个基于教师角色的数据集,旨在支持对教学讲解的自动教学评估器与 AI 导师的评估和训练。数据集包含 854 条讲解,对应来自 ScienceQA 基准精选子集的 139 道题,覆盖 K-12 各年级的科学、语言与社会科学。每道题提供 1 条人类教师讲解,另有 6 条由 LLM 模拟的教师角色生成。这些角色源于真实教育实践中观察到的教学风格与不足,并通过提示工程实例化。我们进一步提出与既有教育标准对齐的教学风险评分规则,落实五个互补的风险维度:事实正确性、讲解深度与完整性、焦点与相关性、学生水平适切性以及意识形态偏见。所有讲解通过经专家教师复核的半自动流程标注二元风险标签。最后,我们给出初步验证实验,评估 EduEVAL-DB 用于评估的适用性。我们将最先进的教育导向模型(Gemini 2.5 Pro)与轻量本地 Llama 3.1 8B 模型对比,并检验在 EduEVAL-DB 上做监督微调能否支持用消费级硬件可部署的模型进行教学风险检测。

EduEVAL-DB:面向教学讲解中教学风险评估的基于角色数据集
图1:本工作用于构建EduEVAL-DB并进行教学风险评估的框架概览。该图展示了所提出流水线的主要阶段:i)定义教学风险评分量表(rubric);ii)EduEVAL-DB的构建与标注,其中每个K–12问题与由LLM模拟教师角色和人类教师生成的多个解释配对,并标注二值风险标签;iii)使用EduEVAL-DB对基于LLM的教学评估器进行基准测试和微调。