论文
医学、人工智能和大语言模型的评估差距:通过概率范式驾驭难以捉摸的基本事实和不确定性
The Evaluation Gap in Medicine, AI and LLMs: Navigating Elusive Ground Truth & Uncertainty via a Probabilistic Paradigm
摘要
对人工智能系统的相对能力进行基准测试,包括大语言模型 (LLM) 和视觉模型,通常会忽略专家底层真实答案中不确定性的影响。这种模糊性在不确定性普遍存在的医学领域尤其严重。在本文中,我们引入了一种概率范式,从理论上解释了即使专家想要获得高分,地面真实答案的高度确定性也几乎总是必要的,而在地面真实答案变化很大的数据集中,随机标记者和专家之间可能几乎没有区别。因此,忽略真实评估数据中的不确定性可能会导致误导性结论,即非专家的表现与专家相似。因此,使用概率范式,我们提出了预期准确度和预期 F1 的概念,以估计专家或系统可以在给定的地面真实答案变异性下获得的分数。我们的工作提出了这样的建议:在建立系统的能力时,结果应该根据真值答案的概率进行分层,通常通过真值专家的一致率来衡量。当整体性能低于 80% 的阈值时,分层就变得至关重要。在分层评估下,高确定性区间中的性能比较变得更加可靠,从而减轻了关键混杂因素——不确定性的影响。
