论文

Immune2V:针对双流图像到视频生成的图像免疫

Immune2V: Image Immunization Against Dual-Stream Image-to-Video Generation

模型评测安全与风险评测

摘要

图像到视频 (I2V) 的生成可能会造成社会危害,因为它使得未经授权的静态图像动画能够创建逼真的深度赝品。虽然现有的防御措施可以有效防止静态图像操纵,但将这些措施扩展到 I2V 生成仍然没有得到充分探索,而且并非易事。在本文中,我们系统地分析了为什么现代 I2V 模型对于幼稚图像级对抗攻击(即免疫)具有高度鲁棒性。我们观察到,视频编码过程迅速稀释了未来帧中的对抗性噪声,并且连续的文本条件指导主动覆盖了免疫的预期破坏性效果。基于这些发现,我们提出了 Immune2V 框架,该框架在编码器级别强制执行时间平衡的潜在发散,以防止信号稀释,并将中间生成表示与预先计算的崩溃诱导轨迹对齐,以抵消文本指导覆盖。大量实验表明,在相同的不可察觉性预算下,Immune2V 比适应的图像级基线产生更强、更持久的退化。