论文

用于自动作文评分的错误监督综合学习者写作

Error-Supervised Synthetic Learner Writing for Automated Essay Scoring

模型训练合成数据

摘要

综合论文有助于减少论文自动评分 (AES) 中对人工撰写数据的依赖。然而,它们通常缺乏现实错误,限制了它们代表真实人类书写的能力,特别是当目标文本旨在类似于语言学习者产生的文本时。在这项研究中,我们提出了一种简单的方法,将错误监督引入合成论文生成中。具体来说,我们对语法错误检测 (GED) 中常用的错误注释文本微调 LLM 生成器。为了评估所提出方法的实用性,我们在三种数据条件下微调和评估 AES 评分器:真实论文、传统生成的综合论文以及使用我们提出的方法生成的综合论文。结果表明,在更大的数据环境中,所提出的方法在 12 个数据集指标比较中的 11 个中优于传统的合成基线,在某些情况下的性能接近在真实论文上训练的模型的性能。尽管取得了这些成果,但在极低资源设置下的性能仍然参差不齐,相对于传统基线的优势只有在 200 篇训练论文中才变得更加明显,尽管在数据集上并不一致。定性和定量分析进一步表明,所提出的方法会产生类似学习者的错误,其分布与真实论文中观察到的分布大致相似。