论文
对胸部 X 射线图像进行文本引导的基于扩散的对抗性攻击
Text-Guided Diffusion-Based Adversarial Attacks on Chest X-Ray Images
摘要
随着人工智能越来越多地融入胸部 X 光 (CXR) 判读、分诊和临床决策支持,了解其对抗性操纵的脆弱性对于安全部署至关重要。然而,现有的鲁棒性评估主要依赖于像素空间攻击,这些攻击引入了数值约束的扰动,但可能不代表合理的射线照相变化。这种限制在多疾病 CXR 分类中尤为重要,其中模型同时评估多种重叠的病理学,而对抗性失败可能会改变多个诊断预测。我们提出了一种基于文本引导的扩散的对抗框架,该框架优化可学习的文本调节,同时保持扩散生成器和目标分类器冻结,从而通过先学习的图像而不是直接的像素操作来实现对抗生成。我们在二元肺不张和多疾病 CXR 分类中评估了跨多个分类器架构的框架,并将其与 FGSM、PGD 和 Carlini-Wagner 攻击进行比较。我们的方法始终导致分类器性能下降最大,在二元分类中将 AUROC 降低至 0.3885-0.5646,在多疾病设置中将 AUROC 降低至 0.4441-0.4878,同时实现卓越的图像保真度(SSIM 0.9080、LPIPS 0.1670、FID 51.23)。重要的是,尽管模型预测发生了重大变化,但临床医生对 95.9% 的二元对抗图像和 73.8% 的多疾病对抗图像的解释保持不变。这些发现揭示了人类和机器解释之间在临床上的重要差异,并表明需要将医疗人工智能鲁棒性评估扩展到传统的像素空间攻击之外,转向生成威胁模型,该模型可以在视觉和临床上合理的图像变化下暴露故障。