论文
调查基于 LLM 的自动论文评分中的第一语言偏差:托福论文开放权重人工智能模型的交叉提示评估
Investigating first-language bias in LLM-based automated essay scoring: A cross-prompt evaluation of an open-weight AI-model on TOEFL essays
摘要
本研究检验了适用于 LoRA 的开放权重 大语言模型 (Gemma-3-27B-it) 应用于自动论文评分的交叉提示泛化和第一语言 (L1) 评分效果。使用“AiAWE:使用 LoRA 适应指令调整模型的开源 LLM 自动写作评估系统”(Gayed,2026 年)中报告的相同模型和推理配置(对来自两个提示的 480 篇议论文进行了微调),我们评估了完整 TOEFL11 语料库的评分准确性:来自以下国家的考生撰写的 12,100 篇文章八个提示中的 11 种第一语言背景,在训练期间没有看到。该模型的原始分数 (0.5-5.0) 映射到 ETS 使用的相同三个熟练程度等级(低、中、高),从而实现直接比较。该模型的整体波段一致性为 77.79%,二次加权 kappa 为 0.702,邻波段一致性为 99.98%。所有八个未见过的提示的准确性都很稳定,与训练数据主题相关的提示没有优势,这表明交叉提示的泛化能力很强。然而,该模型表现出系统性的、与 L1 相关的评分偏移。在每个能力范围内,欧洲语言背景的论文得分始终高于东亚语言背景的论文,这种模式与 微调 数据的构成无关。这是针对自动论文评分的微调开放权重 LLM 的首次大规模 L1 公平性分析。