论文
FOXGLOVE:理解专家的目标导向和锚定写作反馈以及议论文中的 LLM
FOXGLOVE: Understanding Goal-Oriented and Anchored Writing Feedback from Experts and LLMs on Argumentative Essays
摘要
虽然 大语言模型 (LLM) 越来越多地用于生成写作反馈,但在写作研究确定的修订核心维度上,LLM 和专家反馈仍然没有系统的比较:目标导向、锚定特定句子和优先级。我们引入了 FOXGLOVE,这是一个由训练有素的写作教师针对 69 篇十二年级议论文撰写的 696 条反馈评论的数据集,与四个前沿 LLM 在共享协议下生成的 1,644 条评论配对,总计 2,340 条评论。我们对讲师和 LLM 评论的子集提供专家质量评级。我们发现教师和 LLM 在目标和论文位置上分配反馈的方式类似,但教师和模型在提供反馈的具体句子上存在分歧。此外,我们发现模型往往会比教师写出更复杂的反馈,并使用更少的问题。 LLM 反馈在大多数质量维度上也获得了更高的评价(如教师的评价),但这种优势很大程度上归因于较长的评论。 FOXGLOVE 能够系统地比较人类和 LLM 反馈的一致性、分歧和差异。