论文
探索多语言多模式中的对抗鲁棒性和安全性 大语言模型
Exploring Adversarial Robustness and Safety Alignment in Multilingual Multi-Modal Large Language Models
摘要
多模态 大语言模型 将视觉感知集成到语言推理中,引入容易受到对抗性攻击的连续攻击面。之前关于 MLLM 鲁棒性的工作主要集中在以英语为中心的任务上,而没有探索多语言行为。我们通过对 12 种不同语言的对抗稳健性和多模式安全性进行系统研究来解决这一差距,评估通过指令调整获得多语言能力的开源 MLLM。基于梯度的攻击揭示了可转移的多语言漏洞:以一种语言优化的对抗性图像继续导致其他语言的失败,表现出强大的跨语言可转移性。多语言安全性进一步取决于模型检索或解释有害指令的有效性。当通过文本发出有害意图时,具有较强语言基础的语言更容易引起误用反应,而较弱的语言产生的不安全输出较少。当作为印刷内容嵌入图像中时,英语脚本可以被可靠地识别和遵循,而非英语脚本很少被视觉编码器解析。因此,资源较低的语言可能看起来更安全,但这是理解和视觉基础失败的产物,而不是真正的对齐,我们将这种现象称为“安全失败”。相比之下,在整个训练阶段而不是仅在指令调整时构建多语言能力的 MLLM(例如 Qwen3-VL)表现出真正的跨语言安全性,保持跨语言的主动拒绝而不是掩盖理解失败。浅层多语言适应,例如翻译指令数据上的 微调,可能会产生表面层的理解,从而在低资源语言中产生虚幻的安全性;跨训练阶段的更深入整合可实现真正的多语言安全协调。