论文
AIriskEval-edu:人工智能介导的 K-12 教育解释中风险评估的新数据集
AIriskEval-edu: New Dataset for Risk Assessment in AI-mediated K-12 Educational Explanations
摘要
这项工作引入了 AIriskEval-edu-db2,这是一个新数据集,旨在培训和评估基于 LLM 的审核员,以便对 K-12 年级的教学内容进行可解释的教学风险评估。该数据集包含来自 170 个精心策划的 ScienceQA 问题的 1,639 条解释,涵盖科学、语言艺术和社会科学。对于每个问题,数据集都包含由人类教师编写的解释以及由 LLM 模拟的与不同教学风险相关的教师档案生成的 11 条解释。我们提出了一个与既定教育标准相一致的全面风险评估标准,涵盖五个互补维度:事实准确性、深度和完整性、重点和相关性、学生水平的适当性和意识形态偏见。一个关键贡献是添加了 785 个解释和结构化可解释性注释,包括风险定位和风险描述。注释是通过专家教师验证的半自动过程生成的。最后,我们提出了验证实验,在教学风险检测和可解释性评估方面将最先进的专有模型与轻量级本地 Llama 3.1 8B 模型进行比较。这些实验评估 AIriskEval-edu-db2 上的监督 微调 是否使本地可部署模型能够接近或超越更强大的前沿模型,同时在教育审计和评估任务中保护隐私。