论文
重新思考视觉语言模型临床预测中不确定性估计的正确性
Rethinking Correctness for Uncertainty Estimation in Clinical Prediction with Vision-Language Models
摘要
人们越来越多地探索视觉语言模型用于电子健康记录和医学图像的临床预测,其中识别不可靠的预测对于安全部署非常重要。不确定性估计 (UE) 可以检测此类预测,但其评估取决于确定每个模型输出是否正确的正确性标准。如果此标准与人类判断不一致或扭曲下游 UE 性能,则有关模型可靠性的结论可能会产生误导。我们引入了一个两轴框架,通过与人类判断的一致性和对人类参考 UE 性能的保真度来评估正确性标准。我们使用由两名评审员注释的 450 个预测来评估三个临床预测任务和三个模型的八个标准。在审核的任务中,规范精确匹配 (EM) 实现了观察到的最高的人类一致性和最低的 UE 失真,而基于 BERT 的匹配 (BEM) 和 LLM 判断也显示出很强的人类一致性。在四种 UE 方法和 23,254 个临床预测中,标准选择将错误检测 AUROC 改变了高达 0.146,并扭转了 UE 方法的相对排名。 LLM 法官还选择性地接受无效或不确定的输出,接受 30 个此类人为识别错误中的 16 个。这些结果表明,正确性评估是临床 UE 评估的一个组成部分,应在比较 UE 方法之前进行验证。