论文

VPA-Guard:针对视觉提示攻击防御图像到视频生成并对其进行基准测试

VPA-Guard: Defending and Benchmarking Image-to-Video Generation Against Visual Prompt Attacks

AI 基础设施模型评测AI安全与内容治理基础设施安全与风险评测

摘要

图像到视频 (I2V) 生成的最新进展已将输入图像从简单的外观参考转变为交互式控制界面,其中箭头、草图和表情符号等视觉提示以前所未有的可控性协调复杂的视频动态。然而,这些看似无害的静态线索可以被模型解释为可执行的时间指令,在生成的视频中展开为有害的动作。尽管这种威胁很严重,但现有的安全基准仍然主要集中在基于文本和仅基于内容的图像越狱,而对隐式视觉提示攻击的探索还不够。为了弥补这一差距,我们推出了 VVA-Bench,这是第一个用于评估分类的以视觉为中心的即时攻击下视频生成安全性的系统基准。 VVA-Bench 上的大量实验表明,最先进的模型非常容易受到此类攻击,攻击成功率 (ASR) 在 Wan 2.7 上达到 100.0%,在 Veo 3.1 上达到 74.8%。为了减轻这些风险,我们提出了 VPA-Guard,一种检索增强且自我进化的防御框架。通过利用少样本推理来识别潜在的恶意意图,我们的方法将攻击 ASR 平均降低了 44.2%,危害性得分平均降低了 73.4%,同时保持了模型对合法用户编辑的实用性。我们的工作提供了严格的基准和有效的防御策略,以推进安全和对社会负责的多模态生成。