论文
输入级防御是否会转变为对 VideoLLM 的观察级攻击?
Do Input-Level Defenses Transfer to Observation-Level Attacks on VideoLLMs?
摘要
视频 大语言模型 (VideoLLM) 越来越多地部署在内容审核和视频分析等安全关键型应用中。为了有效地处理长视频,VideoLLM 依赖于帧采样、词元压缩和模态融合,它们共同形成一个观察管道,将原始视频简化为紧凑的内部表示。最近的观察级攻击利用此管道来阻止模型感知有害内容,但尚未针对此威胁明确设计防御措施。我们引入了 DefTEval,这是一种受控评估框架,它系统地评估输入级对抗性防御(对已采样帧的像素内容进行操作)是否可以减轻观察级攻击。在五个 VideoLLM、十一种代表性防御和五种攻击类型中,我们发现输入级防御提供的保护有限且不一致,有害检测率通常接近于零。至关重要的是,即使针对在每个采样帧中嵌入有害信号的攻击,防御也会失败,这表明瓶颈超出了采样遗漏,还延伸到了对进入模型的信号的抑制。词元压缩丢弃局部特征,模态融合系统地降低减弱的视觉信号的权重。此外,防御有效性由模型架构决定,而不是由防御方法本身决定,并且不同内容类别的检测率差异很大,暴露了时间推理中的结构弱点。这些发现表明,保护 VideoLLM 需要系统级稳健性机制,涵盖采样感知覆盖保证、安全相关特征的 词元级 保留以及模态平衡融合。