论文

MedFM-Robust:医学基础模型稳健性基准测试

MedFM-Robust: Benchmarking Robustness of Medical Foundation Models

模型评测基准与评测资源

摘要

医学基础模型已经取得了卓越的临床表现,但其在现实世界扰动下的鲁棒性仍未得到充分探索。我们提出了一个鲁棒性基准,包括 8 种成像模式的 40 种扰动类型(12 种基础扰动,28 种医疗特定扰动类型),在 VQA、视觉基础和字幕方面评估了 5 个 VLM(LLaVA-Med、MedGemma、MedGemma-1.5、Gemini-2.5-flash 和 GPT-4o-mini),以及两个分割模型(MedSAM、SAM-Med2D),其中包含五个微调 策略。我们的研究结果表明:(1) 微调 策略在鲁棒性方面占主导地位,LoRA 的性能下降几乎是完整 微调 的两倍,而 SAM-Med2D 的适配器提供了有利的效率与鲁棒性权衡。 (2) 医疗特定扰动不成比例地损害分割,15 个顶级损坏中有 9 个是特定领域的。 (3) LoRA 调整的视觉基础下降超过 40 点,而零镜头字幕保持稳定(下降 <7%)。零样本 VQA 显示了模型相关的稳健性——医学模型下降了 20% 以下,而 Gemini-2.5-flash 下降了 54%。通用 VLM 实现了更高的 VQA 精度,但视觉定位失败;在医疗 VLM 中,MedGemma 表现出最好的整体稳定性。这些结果提供了部署指南,并强调了对医疗人工智能进行特定领域稳健性评估的必要性。我们的代码位于:https://abnerai.github.io/MedFM-Robust。