论文

用于多模态可转移越狱攻击的文本锚定语义扰动 大语言模型

Text-Anchored Semantic Perturbations for Transferable Jailbreak Attacks on Multimodal Large Language Models

模型评测安全与风险评测

摘要

多模态 大语言模型 (MLLM) 在视觉语言交互方面取得了显着进展,但其安全性仍然容易受到越狱攻击。一个关键的挑战是,在文本空间中学习的安全行为无法可靠地转移到融合的跨模态表示,从而使多模态输入可通过潜在语义线索进行利用。我们提出了文本锚定语义扰动攻击(TA-SPA),这是一种黑盒越狱框架,可优化文本锚定语义空间中的可转移扰动。 TA-SPA 集成了文本锚定语义分解(TASF)和语义保留增强(SPA),前者鼓励将跨模态语义因素与特定模态残差分离,后者使有害目标锚多样化,同时保持语义一致性。实验显示出强大的攻击有效性并转移到商业MLLM,在代表性防御下具有竞争性能。额外的控制和探测支持预期的分解,而不意味着完美的解开,激发输入级过滤之外的表示级安全对齐。