论文

对大语言模型的未来信心蒸馏

Future Confidence Distillation in Large Language Models

模型评测鲁棒性、公平性与可信度评测

摘要

可靠的置信度估计对于在置信感知系统中部署 大语言模型 (LLM) 至关重要,其中检索、工具使用和自适应计算等下游决策取决于准确估计答案的可靠性。然而,现有的方法在很大程度上将信心视为已完成回答的属性,而忽略了与信心相关的信息在整个回答过程中如何演变。在这项工作中,我们通过比较前沿和开源 LLM 的解决方案前的知觉 (FOK) 和解决方案后的学习判断 (JOL) 置信度估计,从时间角度研究置信度。我们表明,解决方案后的置信度始终比解决方案前的置信度校准得更好,更具辨别力,而在隐藏表示上训练的线性探针比模型明确表达的要恢复更丰富的置信相关信息。基于这一观察,我们引入了未来置信度 蒸馏,它使用解决方案后正确性探针产生的教师置信估计来训练对解决方案前隐藏表示进行操作的预测器。尽管只需要解决方案前的表示来进行推理,但精炼的预测器可以恢复通过解决方案后的置信度实现的大部分校准改进,保持较高的样本效率,并在同一域内的数据集之间进行传输。总之,我们的研究结果表明,与置信度相关的信息在整个回答过程中不断演变,并且可以在答案生成完成之前进行预测,从而实现更加可靠且低成本的置信度估计。