论文
GeoDetect:VLP 的几何对抗检测
GeoDetect: Geometric Adversarial Detection for VLPs
摘要
视觉语言预训练模型(VLP)广泛应用于现实世界的应用中。然而,它们仍然容易受到对抗性攻击。尽管对抗性检测方法已在单模态设置(视觉或语言)中取得了成功,但其在 VLP 等多模态模型中的有效性和可靠性在很大程度上仍未得到探索。在这项工作中,我们研究了 VLP 嵌入空间的几何形状,并观察了与单峰视觉模型不同的结构化各向异性。我们的理论分析表明,在这种各向异性结构下,对抗性攻击增加了干净样本和对抗样本(AE)之间的预期几何分离。具体来说,我们证明 AE 始终表现出比干净的对应点到随机采样点更大的预期距离,这表明 AE 倾向于将表示推到流形区域之外。基于这些见解,我们提出了 GeoDetect,它通过几何分数利用这些偏离流形的偏差来识别 AE。通过全面的评估,我们表明我们的方法可以可靠地检测跨不同 VLP 架构和威胁设置的 AE,涵盖单模态和多模态攻击以及自适应攻击,从而提供了一种稳健且实用的方法来提高这些模型的安全性和可靠性。