论文

注意差距:通过文本到图像系统中的过滤器生成器差异实现零查询越狱

Mind the Gap: Zero-Query Jailbreaks via Filter-Generator Discrepancy in Text-to-Image Systems

模型评测安全与风险评测

摘要

文本到图像 (T2I) 系统通常在生成器之前具有提示级安全过滤器,以阻止不安全请求,但此类系统仍然容易受到恶意越狱提示的影响。基于转移的攻击会在不询问目标的情况下离线构建对抗性提示,但它们往往会过度拟合单个代理。此外,他们探索了一个巨大的搜索空间,其中语义或感知相似性本身无法保证过滤器规避和不安全生成意图的保留,从而将精力浪费在低潜力的候选者上。我们观察到过滤器和生成器在不同的目标和表示下处理相同的提示,并将这种差距称为过滤器生成器差异(FGD),它允许扰动减少提示对过滤器的感知风险,同时保留生成器所需的视觉概念。在 FGD 的基础上,我们提出了一个零查询越狱框架,通过在标记化和语义阶段可观察的差异规则将扰动筛选为高潜力候选集,然后执行不需要访问目标的代理集成进化搜索。对六个黑盒管道和一个商业在线服务的实验表明,我们的方法始终优于代表性基线,将六个管道的平均攻击成功率提高到 29.2%(MHSC)和 33.3%(Q16),并且比最强的基线分别提高了约 8 个和 12 个百分点。