论文

ConfidenceBench:评估大语言模型的置信度校准

ConfidenceBench: Evaluating Confidence Calibration in Large Language Models

模型评测基准与评测资源

摘要

大语言模型(LLM)日益部署在流畅但错误的答案可能代价高昂的设定中。在这些设定下,仅准确率不够:模型还必须知道自己何时可能出错。我们提出ConfidenceBench,一个校准基准:以Brier分数——激励真实概率报告的恰当评分规则——评估15个前沿LLM的言语化置信估计。置信经提示引出:无需访问模型logits,使框架既适用于闭源也适用于开源系统。基准含200道私有选择题,跨四类:空间推理、高精度数学、词条查询与不可知问题。跨三次独立运行,Claude Opus 4.6与Gemini 3.1 Pro Preview取得最低Brier分数——均报0.103;两者都大幅优于0.1875的校准随机基线,而Gemini 3.1 Flash-Lite得0.367,显示严重失准。准确率与校准跨模型家族大幅背离:最准确的模型不是校准最好的,且若干模型尽管准确率尚可、Brier分数却低于校准随机基线。结果表明言语化置信校准是LLM可靠性的一个独立且实践上重要的轴,补充标准基于准确率的评估。

ConfidenceBench:评估大语言模型的置信度校准:论文配图
图 5:内核平滑可靠性图 [Błasiok 和 Nakkiran,2023]。虚线对角线 = 完美校准。 Claude Opus 4.6 紧密跟踪对角线 (smECE 0.0590.059);尽管 Brier 得分很高,但 Gemini 3.1 Pro Preview 显示出较高的校准误差 (smECE 0.1150.115)。 Gemini 3.1 Flash-Lite 显示出一条接近平坦的曲线,在规定的置信度和经验准确性之间几乎没有关系。