论文

GeoThreat:针对遥感图像解释的大型视觉语言模型的可转移定向对抗攻击

GeoThreat: Transferable Targeted Adversarial Attacks on Large Vision-Language Models for Remote Sensing Image Interpretation

模型评测安全与风险评测

摘要

针对大型视觉语言模型(LVLM)的对抗性攻击是评估其跨模态语义理解鲁棒性的有效手段。现有的研究主要集中在破坏视觉输入以在一般视觉语言任务中引起预定义的错误响应,而遥感领域的相应研究在很大程度上仍未得到充分探索。与自然图像理解相比,遥感图像解释需要对局部判别线索和全局场景上下文进行联合推理。这对在黑盒设置下实现对指定响应的可转移语义操作提出了额外的挑战。为了应对这些挑战,我们提出了 GeoThreat,这是一种针对用于遥感图像解释的 LVLM 的可转移的定向对抗攻击方法。具体来说,GeoThreat 在概念和感知层面上根据目标内容调整对抗性表示。来自代理图像编码器的类标记被用作概念表示,而感知表示是通过协作重要性估计从对抗性示例的补丁标记中提取出来的。除了跨层推出注意力分数之外,我们还结合了对抗性目标相似性梯度,以更忠实地描述局部视觉线索与预期语义操作的相关性。然后,感知表示以交叉注意的方式与目标补丁标记动态对齐,从而促进局部线索适应指定的语义细节。最后,通过基于集合的概念校准和感知适应联合优化来迭代更新对抗性扰动。跨不同 LVLM 的大量实验证明了 GeoThreat 在可转移性和可控性方面的优越性。