论文

医学、人工智能和大语言模型的评估差距:通过概率范式驾驭难以捉摸的基本事实和不确定性

The Evaluation Gap in Medicine, AI and LLMs: Navigating Elusive Ground Truth & Uncertainty via a Probabilistic Paradigm

模型评测评测方法与指标

摘要

对人工智能系统的相对能力进行基准测试,包括大语言模型 (LLM) 和视觉模型,通常会忽略专家底层真实答案中不确定性的影响。这种模糊性在不确定性普遍存在的医学领域尤其严重。在本文中,我们引入了一种概率范式,从理论上解释了即使专家想要获得高分,地面真实答案的高度确定性也几乎总是必要的,而在地面真实答案变化很大的数据集中,随机标记者和专家之间可能几乎没有区别。因此,忽略真实评估数据中的不确定性可能会导致误导性结论,即非专家的表现与专家相似。因此,使用概率范式,我们提出了预期准确度和预期 F1 的概念,以估计专家或系统可以在给定的地面真实答案变异性下获得的分数。我们的工作提出了这样的建议:在建立系统的能力时,结果应该根据真值答案的概率进行分层,通常通过真值专家的一致率来衡量。当整体性能低于 80% 的阈值时,分层就变得至关重要。在分层评估下,高确定性区间中的性能比较变得更加可靠,从而减轻了关键混杂因素——不确定性的影响。

不确定性下的AI专业性错觉:以概率范式应对难以捉摸的真值 配图
图 2:由 5 位放射科医生独立标注、按一致性水平划分的样本比例(CheXpert 测试集,500 个样本)。在 5 种病理中的 4 种里,阳性发现上达到 100% 一致(p_d=1.0)的样本数量骤降至低于 0.01。例外是肺部阴影(lung opacity),其样本比例大致不随一致性水平变化。所有病理的一致性水平见附录 6。