论文

ShieldCLIP:多模态基础模型中有害内容缓解的选择性安全调整

ShieldCLIP: Selective Safety Alignment for Harmful Content Mitigation in Multimodal Foundation Models

模型训练监督微调与指令调优

摘要

像 CLIP 这样的多模态编码器是许多下游系统的基础,但它们的网络规模训练数据嵌入了有害的关联,安全对齐必须抑制这些关联,而不会不必要地改变良性表示。由于道德和实际限制阻止大规模收集真实的不安全内容,因此现有数据集将安全的真实样本与生成的对应样本配对,但将每个生成的样本标记为不安全,即使一种模式单独安全时也是如此。为了解决这个问题,我们引入了 ShieldCLIP,这是第一个根据观察到的每种模态的安全状态而不是样本的来源来调节安全对齐的框架,保留安全内容,同时仅重定向不安全的内容。我们还引入了 ViSUv2,这是一个 195k 四元组数据集,具有跨 578 个概念和 28 个类别的独立的每种模式安全标签。使用这些标签,ShieldCLIP 定义了超越对级监督的四向条件目标:安全内容被锚定,不安全模式被重定向到其安全对应项,混合对仅更新不安全分支,并且当两者都不安全时强制执行一致性。我们在跨模式检索、使用 Stable Diffusion v1.4 和 SDXL 生成文本到图像以及使用 LLaVA 生成图像到文本方面评估 ShieldCLIP。在这些设置中,ShieldCLIP 比之前的安全编码器和强大的缓解基线持续减少有害输出,同时保留原始嵌入空间的实用性。广泛的消融研究进一步表明,特定模式的监督和选择性调整目标都有助于这些成果。源代码、经过训练的模型和 ViSUv2(在受控访问协议下)将在 https://aimagelab.github.io/ShieldCLIP/. 上公开