论文
SEFORA:带有反馈语料库和 LLM 反馈评估框架的学生论文
SEFORA: Student Essays with Feedback Corpus and LLM Feedback Evaluation Framework
摘要
有效的写作反馈是学生学习最强大的驱动力之一,但大规模生产它是劳动密集型的。 LLM 提供了扩展写作支持的自然途径,但存在两个障碍:很少有公共语料库能够捕获教师如何在真实课堂上实际提供反馈,并且没有可靠的方法来衡量生成的反馈是否与教师所写的内容一致。我们解决这两个问题。 SEFORA 是一个公共语料库,将教师内联反馈与作业提示、评分标准、分数和跨各种大学写作流派的多草稿修订相结合,包括 564 份草稿和 8,240 条教师注释。 UniMatch 是一个基于参考的开放式生成评估框架:它将反馈分割成反馈单元,根据教师导出的标准对它们的语义对应进行评分,并通过最佳匹配将它们对齐,以产生可解释的精度、召回率和 F1。在跨越多个 LLM 的 74 个实验配置中,没有设置超过 0.4 F1。 UniMatch 揭示,模型很难确定教师会优先考虑的反馈,并且随着模型生成更多反馈,性能会下降。