论文

分数有多不确定?基于 LLM 自动评估的不确定性度量基准

How Uncertain Is the Grade? A Benchmark of Uncertainty Metrics for LLM-Based Automatic Assessment

模型评测鲁棒性、公平性与可信度评测

摘要

大语言模型(LLM)的迅速崛起正在重塑教育自动评估的格局。尽管这些系统在适应多样题型和输出格式灵活性上优势明显,但也因 LLM 固有的概率性本质带来输出不确定性的新挑战。输出不确定性是自动评估中不可避免的挑战,因为评估结果常常对后续教学行动起关键作用,例如向学生提供反馈或指导教学决策。不可靠或校准不良的不确定性估计会导致下游干预不稳定,可能干扰学生学习过程并造成意想不到的负面后果。为系统理解这一挑战并为未来研究提供参考,我们在基于 LLM 的自动评估情境下对广泛的不确定性量化方法进行基准测试。尽管这些方法的有效性已在其他领域许多任务上得到证明,但其在教育场景特别是自动评分中的适用性与可靠性仍缺乏研究。通过跨多个评估数据集、LLM 家族和生成控制设置对不确定性行为的综合分析,我们刻画了 LLM 在评分场景中表现出的不确定性模式。基于这些发现,我们评估不同不确定性度量的优势与局限,并分析模型家族、评估任务和解码策略等关键因素对不确定性估计的影响。我们的研究为基于 LLM 的自动评估中不确定性特征提供可操作的洞见,并为未来开发更可靠、更有效的不确定性感知评分系统奠定基础。

分数有多不确定?基于 LLM 自动评估的不确定性度量基准
图4:稳定性上各群组内平均排名在模型、问题和策略上的分布。