论文

据报道,对 LLM 的信心不仅仅体现在正确性上

Reported Confidence in LLMs Tracks Commitment More Than Correctness

模型评测模型行为与机制分析

摘要

置信度是对所选答案正确概率的估计。口头置信度报告在 大语言模型 中被广泛用作不确定性度量,但它们是否最好被理解为正确性的估计尚不清楚。我们使用感知决策神经科学中的两阶段弃权范式对此进行测试:模型首先回答并报告其置信度,然后决定是否将其提交给用户或弃权。在四种非推理模型、提示框架和信心格式中,口头信心比答案是否正确更能预测承诺/弃权决定。校准后的标记对数概率显示出相反的情况,弃权预测与正确性辨别相结合,这是答案证据信号的签名。在消除与对数概率共享的口头信心方差后,残差与承诺保持一致,而其与正确性的联系几乎是偶然的。这种分离概括为四种推理模型,涵盖四个不同难度的基准,从困难的多项选择题到前沿水平的自由形式问题。 Gemma 3 和 4 中的机制分析是收敛的:已知因果支持言语信心生成的答案后状态已经在弃权提示之前编码了未来的弃权决定,主要由该决定而不是正确性组织,两者在激活空间中处于近似正交的方向。沿着特定于言语信心的方向引导会导致弃权的发生。因此,口头信心和对数概率信心是不可互换的:对数概率跟踪答案证据和正确性,而口头信心更好地理解为内部提交准备状态的面向行为的读出,挑战了将口头报告视为可靠性代理的做法。