论文

CASA:通过安全关注增强分类,实现稳健的多模式对准

CASA: Classification Augmented with Safety Attention for Robust Multimodal Alignment

模型推理解码与生成控制

摘要

当有害查询利用跨模态交互时,多模态大语言模型 (MLLM) 经常会遇到安全对齐降级的情况。当扩展到两种或多种模式时,仅根据文本对齐的模型显示出更高的成功率。我们提出了一种简单的条件解码策略,CASA(安全注意增强分类),它使用 MLLM 的内部表示在响应生成之前预测二进制安全词元。该分类由安全注意机制引导,该机制计算专用查询提示和输入之间的注意以扩展分类 logits,从而增强模型检测恶意查询的能力。我们的设计确保稳健的安全对准,无需依赖任何外部分类器或辅助头,也无需特定于模态的安全 微调。与之前附加外部分类器或调节头或使用奖励模型重新调整每个生成的词元的安全解码方法不同,CASA 对共享多模态表示做出单一的、内部的、注意力门控的安全决策,这正是让从纯文本训练中学到的安全性转移到图像和音频输入的原因。与跨越文本、图像和音频模式的 7 种攻击类型的 4 个基线模型相比,并在 MM-SafetyBench、JailbreakV-28k 和对抗性音频测试等基准上进行评估,当与标准安全提示(应用于所有基线以进行公平比较)配对时,CASA 的平均攻击成功率相对降低了 90% 以上,而单独使用其内部安全机制则降低了 54--61%。我们的实证评估还表明,CASA~ 在良性输入上保持强大的实用性,并通过自动评估和人工评估(通过 13 个训练有素的注释者)进行验证。总之,这些结果凸显了 CASA 作为一个简单且通用的框架,可以提高多模式 LLM 的安全性。