论文
TempJail:针对图像到视频生成模型的临时越狱攻击
TempJail: Temporal Jailbreak Attacks against Image-to-Video Generation Models
摘要
近年来,图像到视频(I2V)生成模型在主题一致性和时间相干性方面取得了显着进步,从而实现了高质量的视频合成。然而,这些进步也带来了新的安全风险。现有的研究主要集中在涉及单帧违规的越狱攻击,而很大程度上忽略了视频生成模型特有的时间维度。在本文中,我们研究了三种攻击场景,并揭示了 I2V 系统中的一个时间漏洞:不安全的语义可能不是从单个帧中出现,而是从随着时间的推移语义组合中出现。我们进一步确定了此类攻击中的两个关键挑战:时间抽象和语义伪装。为了解决这些问题,我们提出了 TempJail,一种用于 I2V 系统的新型临时越狱框架。对于时间抽象,我们将目标恶意标题分解为初始帧视觉条件和时间文本指令。对于语义伪装,在图像方面,我们将语义注入建模为扩散采样中的受控潜在扰动,并引入来自预训练编码器的梯度引导。在文本方面,我们将标题重写为无害的“主题-动作-场景”模板,该模板绕过安全过滤器,同时保留时间指导。在黑盒推理阶段,这两种模式共同使得恶意语义随着时间的推移逐渐被触发。在 Kling、Seedance、Veo 和 PixVerse 等闭源商业模型上的实验表明,TempJail 在 GPT-5.2 评估下比现有最先进方法提高了 23.3% 的攻击成功率,在人类评估下提高了 22.0%。我们的代码可在 \href{https://github.com/luqi-glory/TempJail}{GitHub} 获取。