论文

自动论文评分和语言认证:评估法语的普遍性、一致性和有效性

Automated Essay Scoring and Language Certification: Assessing Generalizability, Agreement and Validity for French

模型评测评测方法与指标

摘要

在自动作文评分(AES)中,基准测试实践促进了极简主义评估实践,这与评估框架的更广泛视野建议形成鲜明对比,例如基于论证的验证框架(ABV),该框架主张对系统进行多维评估,尤其是在高风险语言测试的背景下。在本文中,我们介绍了 ABV 框架的增强且更实用的版本,其中结合了公平性分析、与语言特征的相关性、预测误差评估以及与人类评分者相比的模型一致性。将此框架应用于法语 AES,我们在包含 27k 篇考试论文的语料库(每篇 2 个评分者)和包含 961 篇论文的泛化语料库(每篇至少有 9 个评分者)上比较了 8 个模型架构。我们的分析说明了应用 ABV 框架的好处,可以更好地了解 AES 模型的功能和缺陷,同时还可以推进法国 AES 的最新技术。