论文
ConfidenceBench:评估大语言模型的置信度校准
ConfidenceBench: Evaluating Confidence Calibration in Large Language Models
摘要
大语言模型(LLM)日益部署在流畅但错误的答案可能代价高昂的设定中。在这些设定下,仅准确率不够:模型还必须知道自己何时可能出错。我们提出ConfidenceBench,一个校准基准:以Brier分数——激励真实概率报告的恰当评分规则——评估15个前沿LLM的言语化置信估计。置信经提示引出:无需访问模型logits,使框架既适用于闭源也适用于开源系统。基准含200道私有选择题,跨四类:空间推理、高精度数学、词条查询与不可知问题。跨三次独立运行,Claude Opus 4.6与Gemini 3.1 Pro Preview取得最低Brier分数——均报0.103;两者都大幅优于0.1875的校准随机基线,而Gemini 3.1 Flash-Lite得0.367,显示严重失准。准确率与校准跨模型家族大幅背离:最准确的模型不是校准最好的,且若干模型尽管准确率尚可、Brier分数却低于校准随机基线。结果表明言语化置信校准是LLM可靠性的一个独立且实践上重要的轴,补充标准基于准确率的评估。
