论文
LLM 评分者的成功与失败之处:来自两次计算机科学考试的证据
Where LLM Graders Succeed and Break: Evidence from Two Computer-Science Exams
摘要
一门大型课程的一次长式考试需要花费数百个评分者的时间,而合格的评分者却很少; LLM 评分者是一个诱人的选择。为了展示其缺陷,我们对实用计算机视觉考试(双等级学生 570 美元)进行了评分,配置为 171 美元,涵盖封闭式和开放权重模型;最好的平均绝对误差为 1.64/35 美元,低于两个人类评分者相互对比的 2.61/35 美元。问题在于提示:简短的“严格评分者”序言将 $17$ 开放权重模型中的 $14$ 驱出评分范围 ($\text{MAE} \ge 8$),三个完全停止评分。这种损害可以追溯到序言中的两个扣留信用的句子,而不是语气或模型规模;其中一个“永远不要给予部分信用”,仅使三个被调查模型中的两个停止评分。三个供应商的封闭旗舰产品将校准转移到该范围内,但仍留在该范围内。在另一门课程($1{,}038$双年级学生)的第二个独立机器学习考试的 162 美元进一步配置中,序言恶化了 10 个模型,使 3 个脱离带区进入崩溃状态,1 个进入拒绝状态,但改进了 7 个模型,其中中性提示超标:漏洞重复,但其方向是特定于考试的。轻度 LoRA 微调修复了它:两个考试的汇总 $\sim 3{,}900$ 评分示例中的一个适配器使五个小型开放模型与人类评分者持平或更好,与评分者对一致,并且对三个严酷角色的敏感性几乎消失 ($\le 0.32$ MAE)。我们发布了匿名数据集、完整的消融网格以及分级、微调和分析管道。