论文

一种增强 LLM 置信度估计的校准反射方法

A Calibrated Reflection Approach for Enhancing Confidence Estimation in LLMs

模型评测评测方法与指标

摘要

部署 大语言模型 (LLM) 的一个关键挑战是开发可靠的机制来估计其置信度,使系统能够确定何时信任模型输出而不是寻求人工干预。我们提出了一种校准反射方法,用于增强 LLM 中的置信度估计,该框架将结构化推理与距离感知校准技术相结合。我们的方法引入了三个关键创新:(1) 最大置信度选择 (MCS) 方法,可全面评估所有可能标签的置信度;(2) 基于反射的提示机制,可增强推理可靠性;(3) 距离感知校准技术,可解释标签之间的顺序关系。我们在不同的数据集上评估我们的框架,包括 HelpSteer2、Llama T-REx 和专有的对话数据集,证明其在对话和基于事实的分类任务中的有效性。这项工作有助于实现为 LLM 开发可靠且校准良好的置信估计方法的更广泛目标,从而实现有关模型信任和人类判断的明智决策。