论文
我们什么时候可以信任 LLM 分级机?校准自动化评估的信心
When Can We Trust LLM Graders? Calibrating Confidence for Automated Assessment
摘要
大语言模型 (LLM) 有望实现自动分级,但其输出可能不可靠。我们不是直接提高评分准确性,而是解决一个补充问题:\textit{预测 LLM 评分器何时可能是正确的}。这可以实现选择性自动化,自动处理高置信度的预测,同时标记不确定的情况以供人工审查。我们在三个教育数据集上比较了七个不同规模(4B 到 120B 参数)的 LLM 的三种置信度估计方法(自我报告置信度、自一致性投票和词元概率):RiceChem(长答案化学)、SciEntsBank 和 Beetle(短答案科学)。我们的实验表明,自我报告的置信度在所有条件下始终达到最佳校准(自我一致性的平均 ECE 0.166 与 0.229)。令人惊讶的是,尽管需要 5倍的推理成本,但自一致性仍然差 38%。较大的模型表现出更好的校准,尽管增益因数据集和方法而异(例如,自我报告的 ECE 降低 28%),GPT-OSS-120B 实现了最佳校准(平均 ECE 0.100)和很强的辨别力(平均 AUC 0.668)。我们还观察到,不同方法之间的置信度存在强烈的顶部偏差,从而创建了一个“置信底线”,从业者在设置阈值时必须考虑到这一点。这些发现表明,简单地要求 LLM 报告他们的置信度,为识别可靠的评分预测提供了一种实用的方法。代码可在 \href{https://github.com/sonkar-lab/llm_grading_calibration}{here} 获取。