论文
多模态LLM中的安全几何坍缩与自适应漂移校正
Safety Geometry Collapse in Multimodal LLMs and Adaptive Drift Correction
摘要
多模态大语言模型(MLLM)常常无法将在文本模态中学到的安全能力迁移到语义等价的非文本输入上,暴露出持续存在的多模态安全鸿沟。我们从表示几何视角研究这一鸿沟,分析文本对齐的拒答方向与模态诱发的漂移方向。我们证明多模态输入会压缩拒答方向上可用的分离度,使其不再能可靠地识别和拒答有害输入。我们将这种失效模式称为安全几何坍缩(Safety Geometry Collapse)。我们通过条件拒答可分性对其进行量化,并表明更强的模态诱发漂移始终对应更弱的拒答可分性和更高的攻击成功率。随后我们通过固定强度的激活干预验证模态诱发漂移的因果作用:抵消估计出的漂移可以恢复拒答可分性并提升多模态安全性。漂移校正之后,我们进一步观察到自我纠偏现象,即模型在前向动力学过程中恢复识别和拒答有害多模态输入的能力。这一效应还提供了模型对每个输入所感知危害性的内部信号。受该信号启发,我们提出ReGap,一种免训练的推理时方法,利用自我纠偏自适应地校正模态漂移。在多个多模态安全基准和效用基准上的实验证明了ReGap的有效性,它在不损害通用能力的前提下显著提升MLLM的安全性。我们的发现突出了表示层面的模态对齐这一关键方向,对实时安全提升以及构建更安全可靠的MLLM具有重要意义。
