论文
缩小 大语言模型 的信心-忠实性 差距
Closing the Confidence-Faithfulness Gap in Large Language Models
摘要
大语言模型 (LLM) 倾向于用语言表达置信度分数,这在很大程度上与其实际准确性无关,但控制这种行为的几何关系仍然知之甚少。在这项工作中,我们提出了一种言语置信度的机械可解释性分析,使用线性探针和对比激活添加(CAA)引导来表明校准和言语置信度信号是线性编码的,但彼此正交——这一发现在三个开放权重模型和四个数据集上是一致的。有趣的是,当模型被提示同时推理问题并用语言表达置信度分数时,推理过程会扰乱语言表达的置信方向,从而加剧错误校准。我们将其称为“推理污染效应”。利用这种洞察力,我们引入了一个两阶段自适应引导管道,该管道读取模型的内部精度估计并引导语言输出以匹配它,从而显着改善所有评估模型的校准对齐。