论文

正确的预测,误导性的解释:论视觉语言模型解释的脆弱性

Right Predictions, Misleading Explanations: On the Vulnerability of Vision-Language Model Explanations

模型评测安全与风险评测

摘要

解释机制越来越多地用于支持视觉语言模型 (VLM) 的透明度和信任,特别是在模型决策需要人工监督的环境中。然而,这些解释的稳健性仍未得到充分理解。在这项工作中,我们研究了 VLM 中的解释热图,特别是基于 CLIP 的模型,是否忠实地反映了对抗条件下的模型推理。我们证明,可以系统地操纵解释图,同时保留模型的原始预测,揭示预测行为和解释 忠实性 之间的脱节。为了研究这个漏洞,我们引入了 X-Shift,这是一种新颖的灰盒攻击,它会扰乱补丁级视觉表示,将解释热图重定向到语义上不相关的区域,而不改变预测的输出。与旨在引发错误分类的传统对抗性攻击不同,X-Shift 特别针对解释过程本身的完整性。该攻击无需修改模型参数即可进行,并可推广到多种 CLIP 架构和解释方法。我们在 ImageNet-1k、MS-COCO 和 Flickr30K 上评估了所提出的方法,证明了在难以察觉的扰动下解释对齐的一致性退化,同时保持了预测稳定性。此外,即使在更大的扰动预算下,标准的面向预测的对抗性攻击也无法重现相同的解释转变行为。我们的研究结果强调了 VLM 当前解释机制的根本局限性,并引起了人们对其在高影响力应用中作为模型可信度的可靠指标的担忧。