论文
VLMShield:视觉语言模型针对恶意提示的高效、稳健防御
VLMShield: Efficient and Robust Defense of Vision-Language Models against Malicious Prompts
摘要
由于视觉集成过程中的对齐减弱,视觉语言模型(VLM)面临着来自恶意提示攻击的严重安全漏洞。现有的防御措施效率和稳健性都受到影响。为了应对这些挑战,我们首先提出了多模态聚合特征提取(MAFE)框架,该框架使 CLIP 能够处理长文本并将多模态信息融合为统一的表示。通过对 MAFE 提取的特征进行实证分析,我们发现良性提示和恶意提示之间存在明显的分布模式。基于这一发现,我们开发了 VLMShield,这是一种轻量级安全检测器,可有效识别多模式恶意攻击,作为即插即用的解决方案。大量的实验证明了其在多个维度上的卓越性能,包括稳健性、效率和实用性。通过我们的工作,我们希望为更安全的多模式人工智能部署铺平道路。代码可从 [此 https URL](https://github.com/pgqihere/VLMShield) 获取。