论文
当背景很重要时:通过可转移攻击打破医学视觉语言模型
When Background Matters: Breaking Medical Vision Language Models by Transferable Attack
摘要
视觉语言模型(VLM)越来越多地用于临床诊断,但它们对对抗性攻击的鲁棒性仍然很大程度上未被探索,构成了严重的风险。现有的医疗攻击侧重于次要目标,例如模型窃取或对抗性 微调,而来自自然图像的可转移攻击会引入临床医生可以轻松检测到的可见失真。为了解决这个问题,我们提出了 MedFocusLeak,这是一种高度可转移的黑盒多模式攻击,它会诱导错误但临床上合理的诊断,同时保持扰动难以察觉。该方法将协调扰动注入非诊断背景区域,并采用注意力分散机制将模型的焦点从病理区域转移。对六种医学成像模式的广泛评估表明,MedFocusLeak 实现了最先进的性能,在不同的 VLM 中生成误导性但真实的诊断输出。我们进一步引入了一个统一的评估框架,该框架具有新颖的指标,可以共同捕获攻击成功和图像保真度,揭示现代临床 VLM 推理能力的关键弱点。