论文

LLM语法纠错的多维度评估

Multi-Dimensional Evaluation of LLMs for Grammatical Error Correction

模型评测模型能力评测

摘要

自动语法纠错助手现已嵌入到为数百万学习者提供服务的教育平台中,但该领域仍存在三个关键差距:(1)最新一代的大语言模型(LLM)缺乏对语法纠正任务的全面评估; (2)组合这些LLM是否提高校正质量尚未探索; (3) 基于参考的指标低估 GEC 系统性能的程度尚未得到充分量化。在这项研究中,我们首先评估了最新一代 LLM 的编辑精度、流畅性保留和意义保留,显示经过微调的 GPT-4o 在所有三个维度上都实现了最先进的性能。其次,通过语法错误类型分析,我们证明各个 LLM 表现出高度相似的纠错模式($ρ=0.947$)。第三,我们表明基于参考的指标低估了 GEC 的性能,其中 73.76% 的 GPT-4o 修正与黄金标准不同,同样有效甚至更优越。这些 GEC 评估结果为教育工作者选择 GEC 助理提供了指导,以增强而不是限制学生的语言发展。我们公开我们的数据、代码和模型。