论文

对置信度分数有信心:调查置信度分数对监督 微调 的敏感性

Confident in a Confidence Score: Investigating the Sensitivity of Confidence Scores to Supervised Fine-Tuning

模型评测鲁棒性、公平性与可信度评测

摘要

不确定性量化技术可测量语言模型输出的置信度,以支持幻觉检测和选择性预测等关键应用。虽然之前的工作已经开发了各种置信度指标,并证明了它们对分类任务或使用语言化置信度的校准,但用于自然语言生成的基于概率和基于自我一致性的 UQ 指标的鲁棒性仍然没有得到充分探索,特别是在模型适应方面。由于从业者通常应用有监督的 微调 来使模型适应新任务,因此出现了一个关键问题:当模型微调时,置信度指标是否保持其校准?我们在 NLG 任务中研究这个问题,包括翻译、问答和数学推理。我们发现 SFT 后校准发生了很大变化:在 216 种配置中,它在 112 种情况下退化,在 104 种情况下改善,置信度分数由于输出质量之外的因素(例如与训练分布的接近程度)而发生变化。因此,退化既不是普遍的,也不是罕见的,并且无法从 SFT 之前的模型中预测其方向。通过下游任务评估,我们表明这种错误校准大大降低了置信度分数用于识别正确答案的实际效用。我们的研究结果表明,在 微调 之后,NLG 的现有置信度指标无法可靠地部署现成的,这凸显了在模型适应下对校准稳健的 UQ 方法的需求。