论文
从局部证据到安全裁决:视觉语言模型的因果追踪
From Local Evidence to Safety Verdicts: Causal Tracing in Vision-Language Models
摘要
视觉语言模型可能需要将图像与提示结合起来,以识别两者都无法单独揭示的安全风险。在模型内部哪里可以访问这种联合安全判断?我们引入了 SSU-Bench,这是一个匹配的安全和不安全图像文本组合的数据集,使用单项提示编辑或带有注释的预期区域的图像编辑构建。使用三种视觉语言模型,我们在成对输入之间传输内部状态,并测量安全判决中产生的变化。在模型和两种类型的反事实中,对更改的输入位置的干预在早期解码器层中有效,而对最终输入 token 的干预稍后生效。从其他示例估计的方向会产生类似的后期层效应。最终 token 状态的线性 读出 还可以预测模型自己的判决,包括错误的判断,并且跨模型比较揭示了反事实变化模式的相似性。这些发现确定了干预措施可以影响联合安全判断的反复转变,并将可读的模型决策与正确的安全判断区分开来。