论文

针对文本到图像模型隐式漏洞的自动红队

Automatic Red Teaming for Implicit Vulnerabilities of Text-to-Image Models

模型评测安全与风险评测

摘要

红队文本到图像 (T2I) 模型对于安全部署至关重要,但针对隐式对抗提示仍然特别具有挑战性。与可以轻松识别和阻止的显式对抗性提示不同,隐式对抗性提示更难检测:这些提示在文本表面上看起来是良性的,但仍然会导致不适当的视觉内容。为了解决这个问题,我们提出了针对隐式漏洞的对抗性探测(AdvPIE),这是一种多模式代理框架,无需访问目标模型的参数即可暴露隐式漏洞。 AdvPIE 采用策略代理根据判断代理的反馈生成和完善隐式对抗提示。为了构建信息反馈,判断代理在迭代过程中在全局和相对级别上提供特定于模态的安全评估。为了有效地利用反馈,我们为策略代理提出了一种新颖的累积对抗性解码策略,该策略动态地重新加权词元分布,以支持导致更多有害图像的词元,同时保留采样多样性。对标准和安全一致的 T2I 模型进行的大量实验表明,AdvPIE1 有效地发现了隐性漏洞,优于各种基线方法。