论文
医学背景扭曲了临床视觉语言模型中的决策
Medical Context Distorts Decisions in Clinical Vision Language Models
摘要
视觉语言模型(VLM)越来越多地被提出用于临床决策支持,但它们在需要整合医疗记录中的视觉和文本上下文的现实场景中的可靠性仍然缺乏表征。本文确定了三种失败模式:(1) 模态过度依赖文本而不是图像,(2) 虚假依赖不相关的临床病史,以及 (3) 对语义等效输入的提示敏感性。我们使用 MIMIC-CXR 在胸部 X 射线任务中评估了一组不同的通用域和医学调整的开放式和封闭式 VLM。通过系统地操纵图像文本对齐、临床病史和提示表述,我们发现即使有视觉证据可用,VLM 决策仍由文本模式主导。此外,我们观察到 VLM 受到不相关报告的严重影响,而微小的提示变化可能会逆转基于图像的正确预测。我们的研究结果强调,在考虑在临床实践中使用这些模型之前,需要进行明确的保障措施和压力测试。