论文

人工智能生成的反馈效果如何?对 20,000 多份 EFL 论文草稿进行内在和外在评估

How Well Does AI-Generated Feedback Work? Intrinsic and Extrinsic Evaluation across more than 20,000 EFL Essay Drafts

模型评测评测方法与指标

摘要

本研究考察了英语作为外语 (EFL) 写作环境中的反馈,重点关注书面纠正反馈 (WCF)。 大语言模型 (LLM) 可以大规模提供 WCF,但将其与教学最佳实践保持一致仍然是一个持续的挑战。 WCF 满足事实性或相关性等标准可能仍然不适合学习环境,这凸显了基于学习者观点进行外部评估的必要性。我们在一个有近 2,000 名学生的大学级 EFL 班级中部署了 WCF 系统,收集了 20,000 多份草稿。我们从两个角度评估生成的 WCF:由经验丰富的英语教师使用评分标准进行的内在评估,以及通过学生反馈和参与度指标进行的外在评估。结果显示,教师专家评分与学生反馈之间的一致性较差。这些发现表明,仅靠传统的专家评估可能无法从学习者的角度充分体现 WCF 的可用性或帮助性,这凸显了以学习者为中心的评估框架对于语言教育中基于人工智能的应用的重要性。