论文
用于对红外视觉语言模型进行定向语义攻击的 QR 结构热触发器
QR-Structured Thermal Triggers for Targeted Semantic Attacks on Infrared Vision-Language Models
摘要
红外视觉语言模型 (IR-VLM) 将热感知扩展到开放词汇分类、图像描述和视觉问答。然而,它们对结构化热扰动的鲁棒性和跨模态语义对齐的稳定性仍然没有得到充分研究。我们提出了 QR-Structured Thermal Triggers (QR-STT),这是一种隐秘的 无需训练 黑盒框架,用于 IR-VLM 的目标语义控制。 QR-STT 保留了 QR 图案的功能区域,同时优化其内部模块,每个模块都分配有冷、中性或热热状态。该框架联合搜索模块拓扑和渲染参数,包括位置、比例、旋转、强度、模糊和圆度。具有贪婪模块翻转细化的三阶段无梯度过程有效地处理混合离散和连续搜索空间。该目标促进与攻击者选择的目标保持一致,抑制源类证据,并规范 QR 结构和视觉相似性。对多个 CLIP 式编码器的实验表明,QR-STT 一致地将图像文本对齐重定向到选定的概念,同时保持视觉隐形。针对分类进行优化的扰动也会转移到图像描述和 VQA,从而导致生成的输出中目标一致的语义漂移。这些结果将 QR 结构热模式识别为语言驱动的红外感知的可解释攻击面,并强调针对结构化跨任务语义攻击进行鲁棒性评估的必要性。