论文
免训练自我报告的语言模型置信度分析
An Analysis of Training-Free Self-Reported Confidence in Language Models
摘要
大型语言模型可以报告数字置信度以及生成的内容,但尚不清楚该报告是否不仅仅是经过校准的修辞。我们分析了三个免训练信号:用答案表达的置信度、事后 $P(\mathrm{True})$ 以及与另外三代人就两个模型系列的相同 100 个 TriviaQA 问题达成的协议。直接语言表达是一个令人惊讶的强大基线:在审核基准错误后,其正确性预测达到 AUROC 0.956 和 0.937。三样本一致性明显较弱(0.765 和 0.790),并且具有口头置信度的固定插值没有统计上可靠的益处。一个模型的九个错误中有四个,另一个模型的八个错误中有两个得到了一致的样本支持,这表明自我一致性可以放大共同的误解。使用相同的提示重新激发对相同固定答案的信心,平均得分会改变 0.043 到 0.084,并以 0.8 的阈值翻转 4\% 到 9\% 的决策。对 100 个带有置信标签的传记主张的探索性审计进一步发现,支持的主张和反驳的主张之间只有适度的置信度差距。这些结果表明,有用的自我报告仍然对启发、相关错误和基准噪声敏感。