论文

风险意识注入:在不损害效用的情况下校准视觉-语言模型的安全性

Risk Awareness Injection: Calibrating Vision-Language Models for Safety without Compromising Utility

模型推理解码与生成控制

摘要

视觉-语言模型(VLM)将大语言模型(LLM)的推理能力扩展到跨模态场景,但在多模态越狱攻击面前仍然高度脆弱。现有防御主要依赖安全微调或激进的 token 操作,带来可观的训练成本或显著损害效用。近期研究表明,LLM 本身能够识别文本中的不安全内容,而 VLM 中视觉输入的引入常常会稀释风险相关信号。受此启发,我们提出风险意识注入(RAI),一个轻量级且无需训练的安全校准框架,通过放大 VLM 中的不安全信号来恢复类似 LLM 的风险识别能力。具体而言,RAI 从语言嵌入构建不安全原型子空间,并对选定的高风险视觉 token 进行针对性调制,在跨模态特征空间内显式激活安全关键信号。这种调制恢复了模型从视觉输入中检测不安全内容的类 LLM 能力,同时保留原始 token 用于跨模态推理的语义完整性。在多个越狱与效用基准上的大量实验表明,RAI 在不损害任务性能的情况下大幅降低攻击成功率。

风险意识注入:在不损害效用的情况下校准视觉-语言模型的安全性
图4:RAI 框架概览。该框架包含两个主要阶段:(1)风险感知注入:包括 (a) 风险感知与稀疏门控(Risk Perception & Sparse Gating),构建不安全原型子空间并识别最相关的风险类别(例如分数为 0.08 的欺诈),以及 (b) 风险信号注入(Risk Signal Injection),通过加权相加操作将选定的风险原型向量显式注入视觉 token。(2)安全激活:所得的风险增强视觉 token 与文本 token 一起输入 LLM 主干,基于丰富后的风险语义激活安全机制(例如安全拒绝)。