论文
在不牺牲信心的情况下校准过度自信:LLM 的探头调节头部干预
Calibrating Overconfidence Without Sacrificing Confidence: Probe-Conditioned Head Intervention for LLMs
摘要
大语言模型 经常对错误的答案表示高度自信。标准校准补救措施通常在全局或分数水平上发挥作用,减少不必要的信心,但也有可能削弱对正确答案的保证信心。我们引入了探针条件头部干预(PCHI),这是一种推理时间方法,它使用冻结探针来检测可能错误但有信心的响应,并在置信度生成期间有条件地重新调整下游注意力头输出。在 Qwen3-4B-Instruct 使用结构化二进制置信度字段解决 OpenMathInstruct 问题时,读出词元 PCHI 将 82.2% 的最初错误是置信度读数转换为 $\texttt{no}$,而跨上游置信度模板词元的联合干预将 ECE 从 21.9% 降低到 9.2%,并且仅损坏最初正确是读数的 5.1%。读出词元效应也出现在 Gemma3-4B 上,尽管上游干预较弱并且更依赖于掩模。这些结果表明,通过有条件地实施内部干预,可以有选择地减少言语上的过度自信,从而部分地将抑制不必要的信心与失去正当信心联系起来。