论文
使用多剪辑视频越狱多模式 大语言模型
Jailbreaking Multimodal Large Language Models using Multi-Clip Video
摘要
随着多模式 大语言模型 (MLLM) 已经能够处理视频输入,人们开始担心它们可能被恶意滥用。之前的越狱研究表明,MLLM 中的安全对齐可以通过视觉输入绕过,但目前尚不清楚视频输入的哪些属性会导致此漏洞。为了解决这一差距,我们引入了多剪辑视频 (MCV) SafetyBench,这是一个包含 2,920 个视频的数据集,旨在评估视频输入的多样性如何影响 MLLM 的脆弱性。每个视频由多个短片组成,描述与有害查询相关的不同上下文。对八个代表性视频 MLLM 进行的实验表明,攻击成功率随着剪辑数量的增加而不断增加。我们的结果进一步表明,视频模态(1)比图像模态更容易受到攻击,(2)比静态视频更容易受到动态视频的影响,(3)当视频包含更多不同的上下文时更容易受到攻击。基于这些发现,我们提出了一种利用图像模态的相对鲁棒性的防御策略。