论文
InfraPatch:针对红外适应视觉语言模型的跨任务目标灰度补丁攻击
InfraPatch: Cross-Task Targeted Grayscale Patch Attacks on Infrared-Adapted Vision-Language Models
摘要
红外视觉语言模型(IR-VLM)已成为低能见度条件下多模态感知的一种有前途的范例,但它们对有针对性的对抗性攻击的鲁棒性仍然知之甚少。现有的对抗性补丁方法主要研究基于 RGB 的模型或单个下游任务,并且没有表征局部扰动是否可以在 IR-VLM 中诱导预期的语义目标。我们提出了 InfraPatch,这是一种白盒、按实例的框架,用于针对 IR-VLM 进行有针对性的数字灰度补丁攻击。 InfraPatch 在大约 5% 的局部区域预算内优化了紧凑的单通道补丁,将代理引导的放置与任务自适应语义目标相结合,并在图像分类、图像字幕和二进制视觉问答中诱导目标行为。我们使用清洁条件目标成功标准,在通过将 DiffV2IR 应用于固定的 30 类 COCO 子集而生成的 300 个合成红外风格图像上评估了 10 个红外适应模型变体。 InfraPatch 在 10 个变体中实现了从 86.00% 到 100% 的定向攻击成功率。在 CLIP 和 BLIP-2 上,代理位置搜索比优化随机放置的成功率分别提高了 6.67 和 10.33 个百分点; LLaVA-1.5 在两种设置下均保持接近 100% 的饱和度。补丁区域和目标消融进一步暴露了跨架构和任务格式的漏洞的巨大差异。这些结果表明,小灰度补丁可以在受控数字威胁模型下跨 IR-VLM 系列注入选定的目标语义,从而激发对红外多模态系统进行更强的鲁棒性评估。