论文
利用项目反应理论估算简答自动评分中LLM的评分能力和回答难度
Estimating LLM Grading Ability and Response Difficulty in Automatic Short Answer Grading via Item Response Theory
摘要
使用 大语言模型 (LLM) 的自动简答评分 (ASAG) 通常使用宏观 F1 和 Cohen's kappa 等聚合指标进行评估。然而,这些指标对于不同评分难度的学生的评分表现如何变化的了解有限。我们引入了基于项目反应理论(IRT)的基于 LLM 的 ASAG 的评估框架,该框架将评分正确性建模为潜在评分者能力和反应评分难度的函数。该公式能够对 LLM 评分者成功或失败的地方进行响应级别分析,并揭示仅从总分中无法看出的鲁棒性差异。我们将该框架应用于 SciEntsBank 和 Beetle 基准测试中的 17 个开放权重 LLM。结果表明,即使具有相似整体性能的模型,随着响应难度的增加,其评分准确性下降的幅度也有很大差异。此外,混淆模式表明,困难答案的错误不成比例地集中在 \texttt{部分正确\_不完整} 标签上,表明在模糊性下中间标签崩溃的趋势。为了描述困难反应的特征,我们进一步分析了估计难度的语义和语言相关性。在这两个数据集中,较高的难度与参考答案的较弱的语义对齐、较强的矛盾信号以及嵌入空间中较大的语义隔离相关。总体而言,这些结果表明,项目反应理论为评估基于 LLM 的 ASAG 提供了一个有用的框架,超越了总体绩效指标。