论文
针对隐私保护的视觉语言模型的不可察觉和可逆的对抗示例
Imperceptible and Reversible Adversarial Examples against Vision-Language Models for Privacy Protection
摘要
视觉语言模型 (VLM) 提供强大的多模式功能,但也使用户面临基于文本的隐私攻击,攻击者会抓取在线照片并查询 VLM 以提取敏感属性。现有的可逆对抗性示例 (RAE) 方法可以在纯视觉任务中保护图像,但在多模态设置中会失败,并且当前 VLM 上的对抗性示例依赖于高频噪声,这会严重降低视觉质量。我们提出了 CloakDiff,这是第一个针对 VLM 中基于文本的查询攻击的可逆、高保真隐私保护框架。 CloakDiff 通过将基于扩散的对抗性编辑与嵌入原始图像以进行无损恢复的可逆网络相结合,产生难以察觉的对抗性示例。它扰乱像素空间嵌入并操纵潜在交叉注意图,以确保强大的跨模型和交叉提示可转移性,同时保留全局视觉结构。为了进一步提高保真度,我们设计了 EDM 启发式采样,这是一种用于对抗性指导的有原则的扩散计划。对多个数据集和 VLM 的实验表明,CloakDiff 提供了具有高视觉质量和可逆性的多模式隐私保护。