论文
针对文本转图像安全过滤器的轻松越狱攻击
Low-Effort Jailbreak Attacks Against Text-to-Image Safety Filters
摘要
文本到图像生成模型广泛应用于创意工具和在线平台。为了减少滥用,这些系统依赖于安全过滤器和审核管道,旨在阻止有害或违反政策的内容。在这项工作中,我们表明现代文本到图像模型仍然容易受到仅需要自然语言提示的轻松越狱攻击。我们提出了一项基于提示的策略的系统研究,该策略绕过安全过滤器,无需模型访问、优化或对抗性训练。我们介绍了视觉越狱技术的分类,包括艺术重构、材料替代、伪教育框架、生活方式美学伪装和模糊动作替代。这些策略通过掩盖良性语义上下文中的不安全意图,利用提示调节和视觉安全过滤方面的弱点。我们在几个最先进的文本到图像系统中评估这些攻击,并证明简单的语言修改可以可靠地规避现有的防护措施并产生受限的图像。我们的研究结果强调了表面级提示过滤与检测生成媒体系统中的对抗意图所需的语义理解之间的关键差距。在所有测试的模型和攻击类别中,我们观察到攻击成功率 (ASR) 高达 74.47%。