论文

当信心失败时:在不确定性和缺失临床信息的情况下对 LLM 过度自信

When Confidence Fails: Overconfidence in LLMs under Uncertainty and Missing Clinical Information

模型评测鲁棒性、公平性与可信度评测

摘要

大语言模型(LLM)在医学问答和临床推理任务中取得了强劲的表现。然而,人们对它们在不确定性下的可靠性仍知之甚少,这引起了在高风险临床环境中部署的严重担忧。在这种环境中,错误的预测本质上是有风险的,但自信的错误预测可能特别有害,因为它们可能会误导临床决策。在本文中,我们对临床信息不确定性下的LLM进行系统的行为分析。我们提出了一个基于 MedMCQA 数据集的评估框架,该数据集由两个互补的不确定性设置组成。首先,我们通过及时修改引入语言不确定性线索来模拟模糊的临床环境。其次,我们构建了一个答案删除设置,其中正确的选项被故意排除,要求模型识别不足的信息并放弃。我们使用多个校准指标来分析模型准确性和置信度行为,包括校准间隙、预期校准误差 (ECE) 和不安全置信错误率 (UCER),涉及 500 个医学问题。我们的结果揭示了一致的故障模式,即,尽管准确性在不确定性增加的情况下下降,但模型置信度仍然与准确性不一致。这导致不安全的置信错误大幅增加,表明模型置信度在很大程度上对有临床意义的信息丢失不敏感。此外,我们观察到,当正确答案不可用时,不同模型的弃权能力存在显着差异,一些模型持续产生高置信度的幻觉答案。这些发现暴露了当前 LLM 认知可靠性的关键局限性,并强调在临床工作流程中部署之前需要不确定性感知评估方法。