论文

VLM 是否跨模式共享安全神经元?

Do VLMs Share Safety Neurons Across Modalities?

模型评测模型行为与机制分析

摘要

视觉语言模型 (VLM) 可以满足通过图像传递的有害请求,即使它们的 LLM 主干网会拒绝文本中的相同内容。虽然之前的工作从经验上或在表征层面上描述了这些越狱的特征,但视觉输入如何扰乱神经元层面的安全路径仍然未知。我们通过对 10 个 VLM 中的安全机制进行因果神经元级分析来缩小这一差距。我们提出了一种具有迭代消融功能的两阶段检测管道,可以实现自我修复,并引入了两个模态隔离的基准 ViSafe-Detect 和 ViSafe-Eval,它们可以解耦视觉和文本安全信号。我们的分析表明:(i) VLM 中的文本安全性是可本地化的:$\sim$88 个神经元 ($<$0.01%) 的目标消融大大减少了拒绝。 (ii) 文本安全神经元构成了主要的拒绝途径:消除它们是唯一能够持续且大幅减少所有模型中的拒绝的干预措施。 (iii) 视觉安全在单神经元水平上是高维和分散的:文本安全集中在 $\sim$5 子空间方向,而视觉安全需要 $\geq$50。这种差距存在于各个架构中,这解释了为什么当前的对齐方式尚未消除视觉安全差距。项目页面位于:https://jiaxuan-li.github.io/vlm-safety-neuron/ 警告:本文可能包含有害内容的示例。