论文
探索并弥补多模态LLM机器遗忘后的知识空洞
Exploring and Bridging Knowledge Holes in Unlearned Multimodal Large Language Models
摘要
机器遗忘为从大规模多模态语言模型(MLLM)中移除不安全内容提供了一种有前景的方法,但机器遗忘的精确性仍然是一个持续的挑战。一个原因是当前的机器遗忘评估范式存在一个关键的盲点:它们通过基准测试模型的表示,这些表示远离遗忘集,无法捕捉知识漏洞——在良性输入上存在严重的退化。为了探查机器遗忘后的MLLM中的知识漏洞,我们构建了一个基准,该基准捕捉与遗忘集共享通用模式的良性输入退化,通过控制实验验证,它们是常用的机器遗忘方法的系统性后果。此外,为了弥合这一差距,我们提出了选择性保护与锚定正则化,通过锚定激活过滤保护通用模式,同时通过实体抽象增强强化这些模式。我们在安全擦除器(SafeEraser)上的实验结果表明,SPAR(Selective Protection with Anchored Regularization)在恢复了超过98%的原始响应质量,标准基线则低于50%;同时攻击成功率为0.00%,模型实用性与竞争基准相当。这些结果强调了对可信的MLLM机器遗忘进行更细致评估的必要性。
