论文

使用 LLM 自动简答评分的置信度估计

Confidence Estimation in Automatic Short Answer Grading with LLMs

模型评测鲁棒性、公平性与可信度评测

摘要

具有生成式 大语言模型 (LLM) 的自动简答评分 (ASAG) 最近在无需特定任务 微调 的情况下表现出了强大的性能,同时还能够生成用于教育评估的综合反馈。尽管取得了这些进步,但基于 LLM 的评分仍然不完善,这使得可靠的置信度估计对于教育决策中安全有效的人机协作至关重要。在这项工作中,我们通过联合考虑基于模型的置信信号和数据集导出的不确定性来研究使用 LLM 进行 ASAG 的置信度估计。我们系统地比较了三种基于模型的置信度估计策略,即言语、潜在和基于一致性的置信度估计,并表明仅基于模型的置信度不足以可靠地捕获 ASAG 中的不确定性。为了解决这一限制,我们提出了一种混合置信框架,它将基于模型的置信信号与数据集衍生的任意不确定性的显式估计相结合。通过对语义嵌入的学生反应进行聚类并量化聚类内的异质性来操作任意不确定性。我们的结果表明,与单一来源方法相比,所提出的混合置信度测量可产生更可靠的置信度估计并提高选择性分级性能。总体而言,这项工作推进了基于信心感知 LLM 的人机参与评估评分,支持更值得信赖的人工智能辅助教育评估系统。