论文
医学视觉语言模型在放射学中学到什么?分布转移下的转移、对齐和源代理泄漏
What Do Medical Vision-Language Models Learn in Radiology? Transfer, Alignment, and Source-Proxy Leakage Under Distribution Shift
摘要
医学视觉语言模型 (VLM) 在域内可能显得可靠,但在采集域、配对监督或评估协议发生变化时会失败。我们将这种故障模式作为与认知智能相关的表征级盲点来研究,而不要求认知不确定性的正式估计量。使用 NIH ChestXray14 和 CheXpert,我们首先将纯源跨数据集视觉传输与无监督的域适应诊断隔离开来。然后,我们使用 PadChest 和 OpenI 在严格的配对索引检索下评估多模态对齐,并量化冻结嵌入中保留的元数据派生的源代理信息。在匹配的 ResNet-18 比较中,自监督视觉初始化比监督 ImageNet 初始化改进了 NIH 到 CheXpert 的传输,而对抗性适应仅在狭窄的范围内有用,并且随着对抗压力的增加而变得不稳定。在外部 OpenI 压力测试下,多模态精确对检索仍然很低,并且源代理信息仍然可以从学习的表示中恢复。定性最近邻分析和 Grad-CAM 分析显示,在许多情况下,临床上合理的跨数据集结构和胸部注意力模式,而设备较多和假阳性病例仍然不明确。辅助架构检查与任务相关,并且不支持通用主干排名。总体而言,该研究表明,单一协议下的明显能力可以隐藏转移、对齐和与捷径相关的故障模式,从而激发对分布转移下的医疗 VLM 进行压力测试评估。