论文
别管我的图像:防止多模态 大语言模型 通过视觉提示注入分析图像
Leave My Images Alone: Preventing Multi-Modal Large Language Models from Analyzing Images via Visual Prompt Injection
摘要
多模态 大语言模型 (MLLM) 已成为分析互联网规模图像数据的强大工具,提供了显着的优势,但也引发了严重的安全和社会问题。特别是,开放权重 MLLM 可能被滥用从大规模个人图像中提取敏感信息,例如身份、位置或其他私人详细信息。在这项工作中,我们提出了 ImageProtector,一种用户端方法,通过嵌入精心设计的、几乎难以察觉的扰动,在共享之前主动保护图像,该扰动充当对 MLLM 的视觉提示注入攻击。因此,当攻击者使用 MLLM 分析受保护的图像时,MLLM 始终会被诱导生成拒绝响应,例如“对不起,我无法帮助满足该请求”。我们凭经验证明了 ImageProtector 在六个 MLLM 和四个数据集上的有效性。此外,我们评估了三种潜在的对策:高斯噪声、DiffPure 和对抗性训练,并表明,虽然它们部分减轻了 ImageProtector 的影响,但同时降低了模型的准确性和/或效率。我们的研究重点关注开放权重 MLLM 和大规模自动图像分析的实际重要设置,并强调基于扰动的隐私保护的前景和局限性。