论文
JECA^2:针对法医视觉语言模型的判断解释一致对抗性攻击
JECA^2: Judgment-Explanation Consistent Adversarial Attack against Forensic Vision-Language Models
摘要
最近开发了取证视觉语言模型(VLM)来检测图像篡改并提供自然语言解释。然而,它们对抗对抗性操纵的鲁棒性仍未得到充分探索。现有的对抗性攻击通常旨在翻转模型的二元判断,而随附的解释仍可能揭示取证线索并与被攻击的判断相矛盾。在本文中,我们研究了针对法医 VLM 的判断-解释一致的对抗性攻击,并提出了 JECA^2,这是一种受控的白盒红队诊断,可联合重定向视觉归因并将文本解释与目标判断保持一致。在视觉方面,JECA^2 使用 Grad-CAM 引导的扰动将归因从被篡改的区域转移到良性区域。在文本方面,它在词元邻近约束下优化了提示嵌入,以实现真实性确认语义。取证 VLM 基准测试表明,与白盒威胁设置下实施的基线相比,JECA^2 实现了更高的攻击成功率和自动判断解释一致性,而向闭源 VLM 的转移仍然可衡量但有限。我们的结果强调了基于解释的取证 VLM 中的一致性故障模式,并激发了未来超越二进制检测准确性的鲁棒性评估。