论文

校准分类,而不是自主:医学视觉语言模型的置信度估计

Calibrated Triage, Not Autonomy: Confidence Estimation for Medical Vision-Language Models

模型评测鲁棒性、公平性与可信度评测

摘要

视觉语言模型可以流利而自信地回答有关胸部X光片或病理切片的问题,而几乎不使用图像,而是依赖于语言先验。在医学上,这是最重要的失败:答案看起来可信,但实际上并不可信,而自然的保障措施是足够可靠的置信度分数,足以表明模型何时应该放弃。我们提出一个部署问题,而不是准确性问题:视觉语言模型可以安全地自行推迟多少医学成像工作,以及哪种置信信号使这成为可能。我们评估了九个置信估计器,涵盖 无需训练 logits 基线、基于提示的自我报告和训练有素的内部探针,涵盖五个开放权重 LVLM 和三个涵盖广泛临床成像、放射学和病理学的医学 VQA 数据集,每个探针仅在自然图像上进行训练,并无需适应即可应用于医学。重铸为有界选择性预测,这种比较是谨慎的。标准指标会产生误导:歧视几乎无法将估计者区分开来,而固定的高置信度截止值将他们分开的程度远没有看上去那么大,因为他们的分数处于无与伦比的规模;没有一个估计器能够可靠地跨领域或模型最佳。可以安全推迟的内容分为两个级别:基础模型能力确定上限,置信层确定可以达到的程度。在 20% 的误差容限下,最强的估计器在无分布保证下推迟了大约四分之一的放射学病例,在保留阈值下推迟了三分之一,几乎没有病理学病例。可用的角色是在临床监督下进行校准分类,而不是自主延迟:一个好的估计器可以使一个有能力的模型在其有能力的地方安全地延迟,但没有一个在基础模型缺乏可靠性的地方产生可靠性。我们用代码发布所有输出、正确性判断和置信度分数。