论文
StructBreak:MLLM中结构认知过载引发的安全失效
StructBreak: Structural Cognitive Overload-Induced Safety Failures in MLLMs
摘要
多模态大语言模型(MLLM)擅长结构推理,却在结构一致性上存在明显的逻辑脆弱性。我们将这一现象命名为结构认知过载(SCO),它是深度推理与安全对齐相互冲突的副产品。然而,已有工作主要针对排版和像素级扰动,对SCO的研究基本处于空白。为此,我们提出StructBreak,一个旨在量化SCO的自动化端到端框架。借助StructBreak,我们发现了一种新颖的高阶认知过载攻击范式;值得注意的是,该攻击在实用的黑盒设置下运行,无需访问模型内部。随后,我们利用该框架建立了一个覆盖十种多样威胁场景的综合基准。在六个领先MLLM上的实证评估显示,SCO极易触发毒性内容生成,平均攻击成功率(ASR)达92%(在Gemini 2.5上最高达97%)。为阐明SCO机制,我们进一步开展了覆盖注意力动态、潜空间拓扑和几何分析的模型层面解释。我们的研究揭示,StructBreak充当了绕过安全过滤器的新型结构通道。此外,固有安全机制效果有限,凸显现行对齐范式不足以应对复杂多模态推理的时代。
