论文
动态防御画像使文生图模型的认知越狱成为可能
Dynamic Defense Profiling Enables Cognitive Jailbreak of Text-to-Image Models
摘要
文生图(T2I)生成模型在合成高质量视觉内容上进展显著,但仍易受对抗滥用,尤其在生成NSFW图像方面。现有越狱攻击主要依赖启发式提示工程或黑盒优化,把模型反馈当作二元信号(成功或失败)。这种粗粒度范式忽视了多样失败模式中嵌入的丰富信息——文本拒绝、视觉拦截、语义净化——导致低效探索与严重语义坍缩。本文提出MIND,一个认知越狱框架:把对抗提示生成重构为对潜在防御机制的信念态推断问题。MIND不是盲目搜索绕过提示,而是通过把多模态反馈解读为高密度信号来主动建模目标系统的潜在防御机制。框架集成三个核心组件:(1)多模态裁判做细粒度反馈分解;(2)防御画像器做迭代信念更新;(3)元记忆模块检索历史上有效的攻击策略。这些组件统一在推理驱动的进化优化过程中,实现自适应且语义一致的越狱生成。在I2P基准上的大量实验证明MIND的有效性:在应用于Stable Diffusion v1.5的六种代表性前后处理防御设定下,MIND取得95.62%的攻击成功率(ASR),显著超过现有方法;该框架的有效性还在四个广泛使用的商业T2I系统上验证,在Wan-2.5上取得91.58%的最高ASR。
