论文
从裂缝中越狱文生图模型:通过多智能体辩论穿越异构安全过滤器
Jailbreaking Text-to-Image Models Through Cracks: Navigating Heterogeneous Safety Filters via Multi-Agent Debate
摘要
文本到图像 (T2I) 模型仍然容易受到越狱攻击,从而引发不安全工作 (NSFW) 内容,尽管越来越多地受到结合文本过滤器、图像分类器和跨模式检测器的异构多层安全堆栈的保护。现有的越狱研究要么针对单个过滤器进行优化,要么通过聚合反馈查询整个管道,这使得识别主动约束并适应跨安全层的冲突变得困难。在本文中,我们介绍了检测表面,这是一个统一的几何框架,它描述了异构 T2I 安全过滤器引起的决策边界及其对越狱搜索空间的联合影响。这一公式表明,成功的规避是由跨层冲突形成的稀疏非凸区域控制的,其中绕过一个过滤器的突变可能会增加对另一个过滤器的暴露。受此分析的启发,我们提出了 CRACK,这是一种用于自适应越狱搜索的多智能体辩论框架,它将越狱搜索分解为探索、诊断和仲裁。 CRACK 协调攻击代理、防御代理和判断代理迭代生成提示突变,获取特定于层的诊断反馈,并通过奖励引导细化来优化突变策略。通过反复的争论,CRACK在保留最初的有害意图的同时,调整其搜索方向以适应不断变化的跨层约束。跨多个 T2I 模型、数据集和安全配置的大量实验表明,CRACK 在复合防御下实现了高达 99.63% 的攻击成功率 (ASR),同时比现有方法需要更少的查询并保持语义保真度。
