论文
过度自信连线:LLM 中夸大的言语自信的机制视角
Wired for Overconfidence: A Mechanistic Perspective on Inflated Verbalized Confidence in LLMs
摘要
大语言模型 通常不仅是错误的,而且\emph{自信地错误}:当他们给出事实上不正确的答案时,他们倾向于用语言表达过高的信心,而不是表示不确定性。这种口头上的过度自信可能会误导用户,并削弱作为可靠的不确定性信号的置信度,但其内部机制仍然知之甚少。我们对 LLM 中这种夸大的语言信心进行了电路级机制分析,围绕三个轴进行组织:将语言信心捕获为可微的内部信号,识别导致其夸大的电路,并利用这些见解进行有针对性的推理时间重新校准。在三个数据集上的两个指令调整的 LLM 中,我们发现一组紧凑的 MLP 块和注意力头集中在中后期层,一致地将置信度膨胀信号写入最终标记位置。我们进一步表明,对这些电路进行有针对性的推理时间干预可以显着改善校准。总之,我们的结果表明,LLM 中的言语过度自信是由可识别的内部回路驱动的,并且可以通过有针对性的干预来缓解。