论文

从裂缝中越狱文生图模型:通过多智能体辩论穿越异构安全过滤器

Jailbreaking Text-to-Image Models Through Cracks: Navigating Heterogeneous Safety Filters via Multi-Agent Debate

模型评测安全与风险评测

摘要

文本到图像 (T2I) 模型仍然容易受到越狱攻击,从而引发不安全工作 (NSFW) 内容,尽管越来越多地受到结合文本过滤器、图像分类器和跨模式检测器的异构多层安全堆栈的保护。现有的越狱研究要么针对单个过滤器进行优化,要么通过聚合反馈查询整个管道,这使得识别主动约束并适应跨安全层的冲突变得困难。在本文中,我们介绍了检测表面,这是一个统一的几何框架,它描述了异构 T2I 安全过滤器引起的决策边界及其对越狱搜索空间的联合影响。这一公式表明,成功的规避是由跨层冲突形成的稀疏非凸区域控制的,其中绕过一个过滤器的突变可能会增加对另一个过滤器的暴露。受此分析的启发,我们提出了 CRACK,这是一种用于自适应越狱搜索的多智能体辩论框架,它将越狱搜索分解为探索、诊断和仲裁。 CRACK 协调攻击代理、防御代理和判断代理迭代生成提示突变,获取特定于层的诊断反馈,并通过奖励引导细化来优化突变策略。通过反复的争论,CRACK在保留最初的有害意图的同时,调整其搜索方向以适应不断变化的跨层约束。跨多个 T2I 模型、数据集和安全配置的大量实验表明,CRACK 在复合防御下实现了高达 99.63% 的攻击成功率 (ASR),同时比现有方法需要更少的查询并保持语义保真度。

从裂缝中越狱文生图模型:通过多智能体辩论穿越异构安全过滤器:论文配图
图1: CRACK的总体框架。CRACK 将快速生成作为多Agent辩论。攻击者变异导致逃避安全过滤,捍卫者通过多层管道评估风险,法官提供奖励反馈。黑色箭头表示前方的生成和评估,而绿色箭头显示的是基于RL的政策更新,以多轮方式指导攻击者。