论文
迈向自我参考分析评估:基于档案的 L2 写作评估方法 LLM
Towards Self-Referential Analytic Assessment: A Profile-Based Approach to L2 Writing Evaluation with LLMs
摘要
自动论文评分 (AES) 研究通常依赖基于排名的相关性指标来验证分析评估。然而,这些指标掩盖了由写作能力本身的结构引起的分析维度之间的内在相互关联和光环效应,从而整体印象渗透到细粒度的成分分数中。因此,高相关性可能会掩盖系统的真实诊断行为。在本研究中,我们提出了一种新颖的自我参考评估框架,该框架侧重于识别学习者内部的优势和劣势,而不是评估学习者之间的排名。我们在公开的 ICNALE GRA 上进行了实验,这是一个独特的密集第二语言写作数据集,由多达 80 名训练有素的评分者进行全面和分析注释。为了获得可靠的参考分数,我们应用两方面 Rasch 模型来校准评估者的严重性,并在十个分析方面和整体熟练程度上得出公平的平均分数。我们在零样本设置中比较了人类操作评估者和三个 大语言模型 (LLM) 的分析评分性能。我们的结果表明,LLM 在识别多个熟练程度方面的相对弱点(负反馈)方面往往优于单个人类评分者,而人类评分者在识别相对优势(正反馈)方面仍然更强。总体而言,我们的研究结果强调了基于排名的分析评估的局限性,并证明了学习者内部基于配置文件的方法在 AES 中评估和部署 LLM 的价值。