论文
安全指令为何让视觉语言模型放弃原本能回答的问题?
When Safety Overrides Vision: Exploring Dynamics between Vision Influence and Safety Alignment in Vision-Language Models
摘要
对齐的视觉语言模型应兼顾视觉依据与安全生成,但相同图像和问题在默认指令下可答,在安全约束指令下却常被拒绝。研究检查是感知信息被抑制,还是视觉证据仍在内部而生成转向拒答。多架构、多模态基准分析显示,拒答过程仍持续受到视觉证据影响,感知依据大体保留。虽然不同架构的拒答表征组织方式差异很大,安全指令均使后期隐藏状态转向拒答解码。定向激活干预抑制拒答相关表征后,无需重训或修改图像即可恢复有视觉证据支持的回答。该现象说明,安全对齐可能覆盖视觉信息的表达,即使模型内部仍保留感知证据。