论文

SafeRI:大视觉语言模型中词元级安全干预的识别与干预

SafeRI: Recognition and Intervention for Token-Level Safety Intervention in Large Vision Language Models

模型推理解码与生成控制

摘要

现有的视觉语言模型安全对齐方法通常会全局修改模型行为:一旦安全参数被训练或加载,它们就会参与不安全和已经安全的生成。这种始终在线的干预可能会不必要地扰乱模型的原始推理路径并降低一般的多模式能力。我们认为,安全调整应该是按需干预,而不是对每个解码轨迹的永久修改。为此,我们提出了一种流式识别和门控 LoRA 框架,以实现 VLM 的内在安全性。在自回归生成期间,轻量级识别器估计当前词元生成前状态是安全还是不安全。其输出更新 LoRA 门以进行以下解码步骤;否则,生成遵循冻结骨干策略。 LoRA 模块根据不安全前缀、转换语句和安全延续进行训练,以便它学会在激活后将不安全生成重定向回安全响应。多个安全和通用基准的实验证明了我们的方法在对齐后设置中的有效性。