论文
是否还有知识可供提取?医学微调视觉语言模型脆弱性的证据
Is There Knowledge Left to Extract? Evidence of Fragility in Medically Fine-Tuned Vision-Language Models
摘要
视觉语言模型(VLM)越来越多地通过特定领域的 微调 进行调整,但目前尚不清楚这是否可以改善表面视觉线索之外的推理,特别是在医学等高风险领域。我们评估了四对开源 VLM(LLaVA 与 LLaVA-Med;Gemma 与 MedGemma),涉及四种难度不断增加的医学成像任务:脑肿瘤、肺炎、皮肤癌和组织病理学分类。我们发现,随着任务难度的增加,表现会下降到接近随机的水平,这表明临床推理有限。医学 微调 没有提供一致的优势,模型对即时制定高度敏感,微小的变化会导致准确性和拒绝率的大幅波动。为了测试封闭式 VQA 是否抑制潜在知识,我们引入了基于描述的管道,其中模型生成纯文本模型 (GPT-5.1) 用于诊断的图像描述。这恢复了有限的额外信号,但仍然受到任务难度的限制。对视觉编码器嵌入的分析进一步表明,失败源于较弱的视觉表示和下游推理。总体而言,医疗 VLM 性能很脆弱,依赖于提示,并且无法通过特定领域的 微调 可靠地改进。