论文

专家验证的 AI 教学材料与学习结果的分布变化

Verified, not generated: expert-verified AI study materials and the distribution of learning gains in a university course

模型评测评测方法与指标

摘要

生成式人工智能在教育领域的实验研究大多报告平均效果,但现场证据表明人工智能可以缩小或扩大成绩差距。我们认为,方向取决于判断负担,学习者在学习之前必须提供筛选人工智能输出的专业知识,而专家验证在发布之前将这种负担从学生转移到负责任的导师身上。我们以两队列双重差分设计测试了参数,其中大学一年级必修经济学课程的一半收到了人工智能生成的播客、常见问题解答和基于测验的学习指南,这些指南是使用基于源的模型制作的,并由指定的研究生助教(170 名学生;340 个考试分数)进行检查。 Access 与 50 分组件上的 2.34 分优势相关。相对于反事实,低于第二分类边界的分数比例下降了 24.7 个百分点,在 23 到 31 分的每个阈值上效果都很显着,并且没有高于这一分数,并且大约四分之三的平均值来自底部五分之一。阈值估计对于从干预前队列中剔除得分最低的学生而言是稳健的;平均效果不是。对 36 名学生的采访和反馈表明,验证标签为学生提供了一个理由来参与人工智能生成的材料,而无需结束对其的审查。对人工智能学习资源的评估仅报告平均效果,无法检测资源旨在帮助的学生是否是受益者。