论文

AEGIS:针对文本到图像模型中视觉同义词越狱的机制引导防御

AEGIS: A Mechanism-Guided Defense against Visual Synonym Jailbreaks in Text-to-Image Models

模型推理解码与生成控制

摘要

文本到图像扩散模型已经实现了高视觉保真度和广泛采用,但当对手利用它们来合成非法内容时,仍然容易受到安全违规的影响。现有的对齐范例,从输入清理到结构特征修剪,主要是围绕过滤、编辑或本地化期间明确暴露的不安全概念进行组织的。这为视觉同义词攻击(VSA)留下了盲点,这是一种越狱,其中看似良性的提示通过隐式视觉关联引发禁止的图像。因此,当前的防御措施面临着安全与实用的困境:它们要么不足以缓解 VSA 威胁,要么过度抑制视觉上相似的良性概念。核心挑战是 VSA 将不安全的目标隐藏在文本表面,同时通过生成时的视觉语义融合来揭示它。因此,在这项工作中,我们从预先指定的不安全概念的静态抑制转向动态跟踪不安全语义在生成过程中如何出现。我们的机制分析表明,VSA 和显式不安全提示通过稀疏的语义注入注意力头聚合,这成为禁止视觉语义的推理时间瓶颈。基于这一见解,我们提出了 AEGIS(通过识别和转向的自适应规避防护),这是一种推理时间防御,仅在已识别的易受攻击的头部应用相似感知排斥。根据 16 条基线进行评估,AEGIS 提高了安全性和实用性。在 SD 1.4 上,它针对域内暴力/裸体 VSA 将 ASR 降低至 $\mathbf{0.00}/\mathbf{0.03}$,并针对域外显式攻击和对抗性攻击实现 ASR $\le \mathbf{0.09}$。它保留了良性保真度,避免抑制硬负概念,并在重新识别每个主干的关键头后转移到 SD 2.1 和 FLUX.1。