论文
利用文本拒绝方向实现多模态安全
Harnessing Textual Refusal Directions for Multimodal Safety
摘要
为了提高大型语言模型 (LLM) 的安全性,我们可以执行训练后对齐或利用激活空间中的拒绝方向。这两种策略在多模态大语言模型(MLLM)中不太可行,因为它们需要不安全的多模态数据,比单模式数据更难收集。在这项工作中,我们放宽了这一限制,并研究直接从大语言模型骨干中提取的文本拒绝方向是否可以跨模态(即图像、视频)进行推广。初步研究结果证实了这种能力,尽管有效性取决于层选择、转向强度和跨模式对齐,后者会导致安全的多模态输入被错误地引导至拒绝。在此基础上,我们引入了与模态无关的拒绝转向(MARS),这是一种轻量级的免训练方法,无需多模态安全数据即可注入多模态安全性。 MARS 通过激活重新居中来纠正模态错位,在几何定义的信任区域内自适应缩放转向强度,并选择最佳干预层,在第一个生成的令牌上运行。 MARS 在五个 SOTA MLLM 的安全性、实用性和视频越狱基准上进行了评估,在保持实用性的同时实现了一致的安全收益。这些结果表明,安全相关结构是跨模态共享的,并且文本拒绝方向是多模态对齐的强大且尚未充分探索的基础。
