论文
暴露可见光-红外 VLM 中的漏洞:具有跨任务可转移性的统一几何对抗框架
Exposing Vulnerabilities in Visible-Infrared VLMs: A Unified Geometric Adversarial Framework with Cross-Task Transferability
摘要
视觉语言模型(VLM)在不同的多模态任务中取得了出色的性能,但它们在可见红外(VIS-IR)场景中的对抗鲁棒性仍未得到充分探索。这一差距至关重要,因为可见光-红外传感广泛应用于现实世界的感知系统中,以支持在具有挑战性的成像条件下的可靠理解。为了解决这种跨模式威胁设置,我们提出了 CFGPatch,这是一种用于攻击 VIS-IR VLM 的弯曲边缘分形几何对抗补丁框架。 CFGPatch建立在三角形分形几何的基础上,用贝塞尔曲线元素取代了刚性的直边基元,保留了多尺度分形自相似性,同时引入了更平滑的轮廓、更丰富的方向变化和更灵活的形状变形。此外,我们设计了一种特定于模态的弗雷泽螺旋渲染机制,将细粒度的纹理扭曲和误导性的感知线索注入可见光和红外图像中。通过将全局弯曲分形几何与基于局部螺旋的外观干扰相结合,CFGPatch 破坏了形状感知和纹理解释。我们进一步采用期望变换(EOT)来提高针对常见图像级变换的鲁棒性。大量实验表明,CFGPatch 可以有效欺骗 VIS-IR VLM,并且在攻击有效性和鲁棒性方面始终优于标准补丁基准。此外,针对零样本分类优化的对抗样本可以很好地迁移到图像字幕和视觉问答,展示出强大的跨任务可迁移性和跨下游任务的通用性。