论文
用于评估开放式问答中校准的语义采样框架
A Semantic-Sampling Framework for Evaluating Calibration in Open-Ended Question Answering
摘要
校准衡量模型的预测置信度是否与其经验准确性相符,对于在医学和法律等高风险领域可靠部署 大语言模型 (LLM) 至关重要。虽然最近的许多工作都集中在改进 LLM 校准上,但同样重要的问题如何在现实设置中对其进行评估仍然尚未开发。开放式问答 (QA) 是现代 LLM 最常见的部署设置,也是现有评估方法的不足之处:基于 logits 的指标需要受限的输出格式和内部概率;口头上的自信是自我报告的,而且常常过于自信;基于采样的方法依赖于特定于任务的提取规则,没有明确的有限样本目标。我们引入了 Sem-ECE(语义采样预期校准误差),这是一种用于开放式 QA 的校准评估框架,它从模型中采样答案,将它们分组为语义类别,并使用结果频率作为置信度。我们在这个框架内研究了两个估计器:Sem$_1$-ECE(相同样本的自我一致性分数)和 Sem$_2$-ECE(将答案选择与置信度评估分开的保留变体)。我们证明两者都是渐近无偏的,并进一步表明他们在简单问题上意见一致,但在困难问题上分歧,Sem$_2$ 实现了严格更小的校准误差,因此他们的差距也可以作为问题难度的诊断。对五个领先商业 LLM 的三个开放式 QA 基准进行的实验与我们的理论预测相符,并表明 Sem-ECE 优于语言置信度和现有的基于采样的方法,同时在内部概率不可用时补充基于 logits 的评估。