论文
评估视觉和文本扰动下视觉语言模型的诊断鲁棒性
Evaluating the Diagnostic Robustness of Vision-Language Models Under Visual and Textual Perturbations
摘要
VLM 的标准准确度指标通常会掩盖敏感领域中的重大可靠性故障。在这项工作中,我们利用经过组织病理学验证的脑 MRI 数据集来系统地评估四个 VLM 家族在证据保存扰动下的诊断鲁棒性。通过重新排序解剖切片和交换目标标签位置,我们评估当临床证据保持不变时模型是否保持一致的预测。我们的结果揭示了呈现顺序稳定性的重大漏洞,在简单序列反转的情况下,模型在高达 48.9% 的情况下表现出预测翻转。我们进一步发现了文本选择偏差,尽管视觉输入相同,但标签重新排序会在高达 67.8% 的病例中触发不一致的诊断。阴性对照测试进一步揭示了诊断过度承诺:在去除专家注释的病变切片后,模型对高达 76.1% 的病例进行了分类诊断。这些结果表明,高精度可能会高估临床可靠性,掩盖了对顺序呈现和文本框架的敏感性,而这些敏感性并未被总体准确性所捕获。我们的研究结果强调了在安全关键的临床应用中部署 VLM 时基于稳定性的指标的必要性。我们的评估数据和代码将在接受后公开。