论文

评估大语言模型生成的学生写作反馈中的反馈焦点和教学适应性

Evaluating Feedback Focus and Pedagogical Adaptivity in LLM-Generated Feedback on Student Writing

模型评测基准与评测资源

摘要

我们调查最先进的大型语言模型(LLM)是否生成反映专家教师在反馈焦点和适应性方面的教学实践的反馈。以前的评估工作已经审查了反馈特征、其对学习的影响及其目标,但反馈的重点及其适应性仍然在很大程度上被忽视。为了弥补这一差距,我们采用 Narciss 的分类法并将其细化为七种反馈焦点类型,以注释教师和大语言模型在三个大学写作课程中生成的反馈。我们发布了 FeedType,这是一个基准,包含来自六位大语言模型在三种提示策略下的带注释的教师和大语言模型反馈。我们评估反馈焦点类型的覆盖范围和分布,并检查大语言模型是否像专家讲师那样在草案阶段和学生表现水平上调整他们的反馈。我们的研究结果表明,虽然大多数大语言模型涵盖了大多数反馈焦点类型,但它们未能反映教师的反馈分布,并表现出不同程度的适应性,没有一个与教师的适应性行为相匹配。我们相信 FeedType 将支持未来关于 LLM 反馈生成中教学一致性的研究。