论文

揭示物理世界语义漏洞:红外视觉语言模型的通用对抗补丁

Revealing Physical-World Semantic Vulnerabilities: Universal Adversarial Patch for Infrared Vision-Language Models

模型评测安全与风险评测

摘要

红外视觉语言模型(IR-VLM)对于低能见度环境中的语义感知变得越来越重要,但它们对物理语义攻击的鲁棒性仍未得到充分探索。现有的对抗性补丁方法主要针对红绿蓝 (RGB) 图像或封闭式红外探测器而设计,并不直接解决开放式 IR-VLM 任务,其中一个可部署的工件可以同时影响分类、字幕和视觉问答 (VQA)。我们提出了通用曲线网格补丁(Universal Curved-Grid Patch),缩写为 UCGP,这是一种针对 IR-VLM 量身定制的通用物理对抗补丁框架。 UCGP 将补丁表示为可部署的低频弯曲网格,并通过表示驱动的子空间偏离、拓扑破坏和局部外观正则化目标对其进行优化。元差分进化 (MetaDE) 通过两种物理鲁棒性增强来搜索斑块参数:针对成像变化的期望变换 (EOT) 捕获采样和针对非刚性局部形状变化的薄板样条 (TPS) 斑块变形建模。 UCGP 不是操纵标签或提示,而是破坏视觉表示空间中的干净类别流形,随后显示为降级的跨模态输出。实验表明,单个共享补丁会降低不同 IR-VLM 架构之间的分类、字幕和 VQA,同时在评估条件下保留可测量的跨模型传输、跨数据集泛化、跨类别可扩展性和真实场景物理有效性。这些结果揭示了当前红外多模态系统中的鲁棒性盲点。代码和可重复性资产可在 https://github.com/dyx6663/UCGP 上获取。