论文
自信但不可靠:脑 MRI 视觉语言模型的行为安全审核
Confident but Unreliable: A Behavioral Safety Audit of Vision-Language Models on Brain MRI
摘要
包括医学专家在内的视觉语言模型(VLM)越来越多地被提议用于医学成像,但它们所声明的置信度很少与正确性分开评估。我们使用脑部 MRI 作为受控的高风险测试平台,用于前沿多模态系统中更广泛的故障模式:模型可能看起来很有能力,但缺乏可靠的自我认知。我们提出了对 6 个指令调整的 VLM(5 个通用和 1 个医学专家)对 4,102 个图像(来自 250 个受试者的 4,032 个轴向/冠状/矢状 MRI 切片加上 70 个非大脑/噪声控制)的自动分级行为审核和试点研究,标签来自公共元数据和发布的专家分割掩模,而不是新的人工注释。在各个模型中,答案覆盖率接近完整,但言语置信度校准较差:ECE 范围为 0.27 至 0.40,错误答案的平均置信度范围为 0.82 至 0.97,33-46% 的回答项目属于高置信度错误。最准确的模型对其错误也是最有信心的,而基础/专家家庭对比表明,医学适应改善了肿瘤存在检测,但没有提高置信可靠性。开放式诊断进一步表明,幻觉和弃权与多项选择的准确性是分开变化的。这些发现表明,医学图像 VLM 评估应该报告言语置信度可靠性、置信错误、幻觉和弃权以及准确性。