论文
面向多模态大语言模型的关系感知安全遗忘
Relationship-Aware Safety Unlearning for Multimodal LLMs
摘要
生成式多模态模型可能表现出本质上具有关系性的安全失效:两个良性概念在被特定动作或关系连接时可能变得不安全(例如儿童-饮用-酒)。现有的遗忘与概念擦除方法通常针对孤立概念或图文对,这可能对相同对象和关系的良性使用造成附带损害。我们提出关系感知安全遗忘:一个显式表示不安全的对象-关系-对象(O-R-O)元组,并应用有针对性的参数高效编辑(LoRA)来抑制不安全元组、同时保留对象边际分布与安全邻近关系的框架。我们提供了基于 CLIP 的实验,以及在改写、上下文和分布外图像攻击下的鲁棒性评估。
