论文

通过因果发现和双模态安全子空间投影诊断和修复视觉语言模型中的不安全通道

Diagnosing and Repairing Unsafe Channels in Vision-Language Models via Causal Discovery and Dual-Modal Safety Subspace Projection

模型评测安全与风险评测

摘要

大型视觉语言模型(LVLM)在多模态理解和推理任务中取得了令人印象深刻的性能,但其内部安全机制仍然不透明且控制不佳。在这项工作中,我们提出了一个用于诊断和修复 LVLM (CARE) 内不安全通道的综合框架。我们首先进行因果中介分析,以识别对不安全行为负有因果责任的神经元和层。基于这些发现,我们引入了一种双模态安全子空间投影方法,该方法通过良性和恶意激活之间的广义特征分解来学习视觉和文本模态的广义安全子空间。在推理过程中,激活通过混合融合机制动态投射到这些安全子空间,该机制自适应地平衡视觉和文本校正,有效抑制不安全特征,同时保持语义保真度。对多个安全基准的大量实验表明,我们的因果子空间修复框架显着增强了安全鲁棒性,而不会降低一般的多模态能力,优于先前的激活转向和基于对齐的基线。此外,我们的方法表现出良好的可转移性,可以防御看不见的攻击。