论文大语言模型的置信度校准Confidence Calibration in Large Language ModelsNoam Michael, Daniel BenShushan, Jacob Bien, Don A. Moore·来源日期:2026.04.03模型评测鲁棒性、公平性与可信度评测收藏摘要原文译文我们研究大语言模型(LLM)置信度在多样任务上的校准情况。这项预注册研究的结果表明,当前的LLM像人一样过于确信自己正确:平均而言,置信度超过了准确率。然而重要的是,这一倾向受到强大的难易效应调节:在困难测试上过度自信最为严重;相比之下,简单测试实际上表现出明显的自信不足。我们开发了LifeEval,一个用于评估模型在不同难度水平上校准情况的测试。