论文

LLM 整体和分析评分标准下的作文评分:提示效应和偏见

LLM Essay Scoring Under Holistic and Analytic Rubrics: Prompt Effects and Bias

模型评测鲁棒性、公平性与可信度评测

摘要

尽管人们对使用 大语言模型 (LLM) 进行教育评估越来越感兴趣,但仍不清楚它们与人类评分的吻合程度。我们在三个涵盖整体评分和分析评分的开放论文评分数据集(ASAP 2.0、ELLIPSE 和 DREsS)中对指令调整的 LLM 进行了系统评估。我们分析与人类共识分数的一致性、方向性偏差以及偏差估计的稳定性。我们的结果表明,强大的开放权重模型在整体评分上与人类实现了中度到高度的一致性(二次加权 Kappa 约为 0.6),但这并不能统一转移到分析评分。特别是,我们观察到语法和约定等低阶关注点 (LOC) 特征存在较大且稳定的负向偏差,这意味着模型对这些特征的评分通常比人类评分者更严格。我们还发现,在多特征分析评分中,简洁的基于关键字的提示通常优于较长的标题式提示。为了量化检测这些系统偏差所需的数据量,我们计算平均偏差的 95% 自举置信区间排除零的最小样本量。该分析表明,LOC 偏差通常可以通过非常小的验证集来检测,而高阶关注 (HOC) 特征通常需要更大的样本。这些发现支持偏差校正优先的部署策略:可以使用小型人类标记的偏差估计集来估计和校正系统分数偏移,而不是依赖原始的零样本分数,而不需要大规模的 微调。