论文

相同的模型,不同的弱点:语言和模态如何重塑前沿 MLLM 中的越狱攻击面

Same Model, Different Weakness: How Language and Modality Reshape the Jailbreak Attack Surface in Frontier MLLMs

模型评测安全与风险评测

摘要

多模态 大语言模型 (MLLM) 的攻击面与语言相关,揭示了对齐失败的机械结构。我们提出了第一个系统的跨语言、多模式红队研究,比较了四个前沿 MLLM 中美国英语 (en-US) 和墨西哥西班牙语 (es-MX) 的越狱漏洞:Claude Sonnet 4.5、GPT-5、Pixtral Large 和 Qwen Omni。使用在纯文本和多模式条件下管理的 363 个不同提示场景的固定对抗基准,我们从每个语言组的 9 个母语注释者的匹配面板中收集了 52,272 个危害评级和二进制攻击成功判断。我们的主要发现是语言并不能统一地衡量脆弱性。贝叶斯混合效应分析表明,在西班牙语提示下,诸如角色扮演之类的语言框架攻击的有效性大大降低,而视觉上明确的多模态攻击变得更加有效,这直接暗示了提示语言界面而不是全局注释器的宽大处理。这种分离表明语言和视觉对齐失败是通过不同的机制起作用的,并且切换语言足以暴露这种分离。实际后果是安全排名无法跨语言保存。 Qwen Omni 取代 Pixtral Large 成为 es-MX 参与者中最脆弱的模型,这是一种排名逆转,英语条件分数的标量校正无法恢复,并且绝对攻击成功率在模型代之间有所下降,但没有缩小它们之间的差距。这些发现表明,将语言和模态视为独立维度的安全评估框架从根本上错误地指定了全球部署的 MLLM 的攻击面,必须相应地重新设计。