论文
深入研究针对图像到视频和基于 微调 的定制的统一视频保护的临时挑战
Delving into the Temporal Challenges of Unified Video Protection Against Image-to-Video and Fine-Tuning-based Customization
摘要
最近基于扩散的视频生成模型已经通过基于调整的管道(微调视频扩散模型)和基于参考的管道(例如图像到视频生成)实现了高质量的个性化视频定制。然而,这些功能引起了对个人隐私、身份所有权和知识产权保护的严重担忧。现有的反定制工作侧重于保护图像,而针对基于参考和基于调整的定制的视频保护在很大程度上仍未得到充分探索。在这种情况下保护视频提出了三个挑战:(i) 逐帧优化的图像级扰动无法承受 3D 视频 VAE 的时间压缩。 (ii) 在单个视频上优化的视频级扰动容易受到时间编辑的影响,并且无法保护看不见的视频。 (iii) 时间不一致的扰动对于时间攻击并不稳健。为了应对这些挑战,我们提出了时间一致的通用对抗性扰动(TC-UAP),这是针对基于参考和基于调整的视频定制的第一种保护方法。 TC-UAP 在多个视频的滑动窗口上优化身份级多帧 UAP,考虑到视频 VAE 中时间压缩引起的局部时间依赖性,并启用单个扰动来保护不同长度的未见过视频。此外,我们引入了内在时间模型和外在代理时间攻击损失,这使得扰动在时间上一致并且对看不见的时间攻击具有鲁棒性。经验、定量和定性结果表明,与基于参考和基于调整的视频定制的现有方法相比,TC-UAP 实现了最强的身份保护,并且在多种看不见的时间攻击下仍然保持鲁棒性。