论文

QuISE:通过与查询无关的语义编辑防御 VLM 上的印刷攻击

QuISE: Defense against Typographic Attacks on VLMs via Query-Irrelevant Semantic Editing

模型推理推理验证与自校正

摘要

印刷攻击通过将误导性文本注入图像并导致模型依赖对抗性文本线索而不是视觉证据,对视觉语言模型(VLM)构成严重威胁。现有的防御通常需要特定于模型的修改、额外的训练或访问内部模型组件,从而限制了它们对现代闭源 VLM 的适用性。在本文中,我们提出了 QuISE,一种与模型无关的、基于查询无关语义编辑的 无需训练 黑盒防御。 QuISE 首先通过影响感知文本本地化来识别可能影响当前查询的文本区域。然后,QuISE 将这些区域替换为两个语义不同的替换文本,这些文本与查询和图像均无关。最终答案由编辑后图像的答案一致性决定。对三个印刷攻击基准、四种攻击设置和四个 VLM 进行的大量实验表明,QuISE 持续提高了防御准确性。 QuISE 的回收率为 67.9-75.0%,危害率为 0.5-1.1%。