论文
SPACE:MLLM 的无源代理锚概念擦除
SPACE: Source-free Proxy Anchor Concept Erasure for MLLMs
摘要
随着多模式 大语言模型 (MLLM) 面临日益增长的隐私风险和监管限制,机器遗忘 (MU) 已成为删除敏感数据同时保持模型性能的关键解决方案。然而,现有的 MU 方法通常依赖于目标概念的可视化数据,而由于严格的数据保留策略,这些数据通常不可用,从而产生了对无需访问目标数据即可运行的无源遗忘方法的需求。在这项工作中,我们提出了无源代理锚概念擦除(SPACE),这是第一个专门针对 MLLM 的无源学习框架。 SPACE由两个阶段组成:(1)文本引导代理锚选择(TPAS),它从共享特征空间中检索语义对齐的代理锚。 (2)双约束语义隔离(DCSI),它优化这些锚点以间接擦除目标概念。 DCSI 将更新限制在保留知识的零空间,确保结构完整性。我们从理论上证明,SPACE 严格限制了对保留知识的扰动,并使特征谱熵最大化,从而保持了模型的性能。此外,跨六个数据集的广泛实验表明,SPACE 的性能可与最先进的数据依赖方法相媲美,验证了其在无源 MU 场景中的有效性。源代码将被发布。