论文
风险意识注入:在不损害效用的情况下校准视觉-语言模型的安全性
Risk Awareness Injection: Calibrating Vision-Language Models for Safety without Compromising Utility
摘要
视觉-语言模型(VLM)将大语言模型(LLM)的推理能力扩展到跨模态场景,但在多模态越狱攻击面前仍然高度脆弱。现有防御主要依赖安全微调或激进的 token 操作,带来可观的训练成本或显著损害效用。近期研究表明,LLM 本身能够识别文本中的不安全内容,而 VLM 中视觉输入的引入常常会稀释风险相关信号。受此启发,我们提出风险意识注入(RAI),一个轻量级且无需训练的安全校准框架,通过放大 VLM 中的不安全信号来恢复类似 LLM 的风险识别能力。具体而言,RAI 从语言嵌入构建不安全原型子空间,并对选定的高风险视觉 token 进行针对性调制,在跨模态特征空间内显式激活安全关键信号。这种调制恢复了模型从视觉输入中检测不安全内容的类 LLM 能力,同时保留原始 token 用于跨模态推理的语义完整性。在多个越狱与效用基准上的大量实验表明,RAI 在不损害任务性能的情况下大幅降低攻击成功率。
