论文

用于保护多模式的字典对齐概念控制 LLM

Dictionary-Aligned Concept Control for Safeguarding Multimodal LLMs

模型推理解码与生成控制

摘要

多模式 大语言模型 (MLLM) 已被证明容易受到恶意查询的攻击,从而引发不安全的响应。最近的工作使用即时工程、响应分类或微调来提高 MLLM 安全性。然而,此类方法通常对不断演变的恶意模式无效,可能需要重新运行查询,或者需要大量的计算资源。最近,在推理时引导冻结模型的激活已成为一种灵活且有效的解决方案。然而,现有的 MLLM 转向方法通常仅处理一组狭窄的安全相关概念,或者很难在不影响其他概念的情况下调整特定概念。为了解决这些挑战,我们引入了字典对齐概念控制(DACO),这是一个利用策划概念字典和稀疏自动编码器(SAE)来提供对 MLLM 激活的精细控制的框架。首先,我们通过检索超过 400,000 个描述—图像刺激并将其激活总结为概念方向,整理了包含 15,000 个多模态概念的字典。我们将数据集命名为 DACO-400K。其次,我们证明了精选字典可用于通过稀疏编码来干预激活。第三,我们提出了一种新的引导方法,使用我们的字典来初始化 SAE 的训练,并自动注释 SAE 原子的语义以保护 MLLM。在跨安全基准(例如 MM-SafetyBench、JailBreakV)的多个 MLLM(例如 QwenVL、LLaVA、InternVL)上进行的实验表明,DACO 在保持通用功能的同时显着提高了 MLLM 的安全性。