论文

一致性的代价:利用视觉锚点进行视频生成中的多模式越狱

The Price of Consistency: Exploiting Visual Anchors for Multimodal Jailbreaking in Video Generation

模型评测安全与风险评测

摘要

视频生成的快速发展已经将范式从纯文本驱动转变为多条件可控生成,参考图像现在被广泛采用作为条件输入以实现卓越的时空一致性。虽然这些参考图像作为强大的视觉锚点,显着增强了可控性,但它们对安全的影响在很大程度上仍未被探索。在这项工作中,我们揭示了视觉锚定效应:通过强制一致性,该机制可以防止生成的内容偏离最初的有害意图,从而消除模型从有害内容到良性内容的自然安全逃逸路线。因此,视觉锚本质上增加了安全风险——这就是一致性的代价。基于这一见解,我们提出了通过视觉锚点解耦意图(DIVA),这是一种利用此漏洞的用于视频生成的 无需训练 多模式越狱框架。 DIVA 将有害意图解耦为静态视觉锚图像和动态运动文本提示,并采用双标准选择来平衡攻击隐秘性和语义保留。在各种领先的商业平台和主流开源视频生成模型上进行的大量实验表明,DIVA 的攻击成功率比现有的纯文本方法要高得多。为了促进未来的研究,我们还贡献了 TI2VSafetyBench,这是第一个用于多条件视频生成的安全基准。