论文

LLM 评委作为评分者:公共语料库中 LLM 作文评分的严重性、光环、可靠性和版本不稳定的预注册审核

LLM Judges as Raters: A Pre-Registered Audit of Severity, Halo, Reliability, and Version Instability in LLM Essay Scoring on Public Corpora

模型评测鲁棒性、公平性与可信度评测

摘要

大语言模型 (LLM) 越来越多地用作学习分析中的论文评分器,几乎完全使用协议统计数据进行评估。教育测量警告说,评估者在严重程度、表现光环和工具漂移方面也存在差异。我们将 LLM 法官视为评分者,并在两种语言的公共语料库(ENEM/Essay-BR;ASAP)上运行预先注册的评分者效应电池(多方面 Rasch 严重性、残留光环、概括性/决策研究、跨版本转换、差异功能):2,377 篇文章、12 名评委、4 个提供者、5 个版本对比、复制单元,作为分数发布张量。 ENEM 的评分标准为 0-1000,评判严重程度为 219 分;在 ASAP 上,小组差距为分数范围的 15-33%,而受过训练的人类之间的差距接近 1%。法官与人类的相关性处于无差别的 0.47-0.56 范围内。所有五个版本对比的严重程度都超出了家庭排列零值(高达 133 分),并且一名法官在研究中被弃用,被身份金丝雀捕获。两项预先注册的测试返回了诚实的空值:严重性调整后的排行榜逆转无法在排列空值中幸存,并且“无声漂移”被驳斥:在五个对比中的四个中,协议随着严重性的变化而变化。复制产生了自我一致性(在 k<=2 时 phi>=.80),但不是人类水平的准确性,并且同一仪器检查推翻了我们自己的光环比较:在仪器和校准上匹配,我们没有发现可靠的证据表明判断光环超出了受过训练的人类范围。