论文
像素之间的读取:对文本到图像模型的铭文越狱攻击
Reading Between the Pixels: An Inscriptive Jailbreak Attack on Text-to-Image Models
摘要
现代文本到图像 (T2I) 模型现在可以呈现清晰的段落长度文本,从而实现全新的误用类别。我们识别并形式化了铭文越狱,其中对手强迫 T2I 系统生成嵌入在视觉良性场景中的包含有害文本有效负载(例如欺诈性文档)的图像。与引起视觉上令人反感的图像的传统描述性越狱不同,铭文攻击将文本渲染能力本身武器化。由于现有的越狱技术是为粗略的视觉操作而设计的,因此它们很难在保持字符级保真度的同时绕过多级安全过滤器。为了暴露这个漏洞,我们提出了 Etch,一个黑盒攻击框架,它将对抗性提示分解为三个功能正交的层:语义伪装、视觉空间锚定和印刷编码。这种分解将整个提示空间上的联合优化减少为可处理的子问题,这些子问题通过零阶循环迭代地细化。在此过程中,视觉语言模型会批评每个生成的图像,将故障定位到特定层,并规定有针对性的修订。对 7 个模型在 2 个基准上的广泛评估表明,Etch 的平均攻击成功率为 65.57%(峰值为 91.00%),显着优于现有基准。我们的结果揭示了当前 T2I 安全调整中的一个关键盲点,并强调了对排版感知防御多模式机制的迫切需要。