论文
大语言模型 置信度的计算基础
The Computational Basis of Confidence in Large Language Models
摘要
可靠的置信度——模型自己的答案正确的概率——对于语言模型的可信部署至关重要。现有的工作很大程度上通过预测正确性以及是否经过校准来评估置信度,从而留下了一个更基本的问题:置信度信号本身代表什么?答案 logits 可能反映足以计算规范置信度的潜在决策变量,或者反映以非贝叶斯方式组合可用证据的启发式偏好信号。我们使用统计决策置信度(SDC)来解决这个问题,这是计算神经科学的规范框架。将答案 logits 差异 (LD) 视为潜在决策变量的候选读数,我们测试 SDC 预测的定性特征。在三个感知辨别任务和一个基于记忆的决策任务中,跨越三个多模态非推理模型和一个推理模型,LD 满足这些特征(包括诊断正确/错误折叠 X 模式),表明在这些设置中,答案 logits 表现为潜在决策变量的单调读数,而不是启发式偏好分数。在复杂的视觉推理中,LD 继续预测超出客观任务难度的正确性,但缺乏 SDC 的完整几何特征,这说明了当明确的规范过程模型不可用时框架的当前边界。这些结果提供了多模态语言模型中置信度的计算说明,描述了答案 logits 何时充当潜在决策变量的读数,并将 SDC 建立为研究跨生物和人工智能置信度的统一框架。