论文
迈向细粒度遗忘:多模态LLM的属性遗忘
Toward Fine-Grained Forgetting:Attribute Unlearning for Multimodal Large Language Models
摘要
多模态大语言模型(MLLMs)表现出强大的视觉-语言能力,但也可能记忆和泄露敏感信息。机器卸载旨在在不从头开始重新训练的情况下删除指定的知识,同时保留一般用途。现有的隐私导向基准主要采用细粒度删除,而实际请求往往更加精细:模型应忘记指定的属性,同时保留相同身份的非敏感信息。因此,我们引入细粒度的模型-属性卸载任务,并构建一个覆盖长文本、数值和短文本目标、多种卸载比率和多样问题类型的基准。我们的评估揭示了目标和保留的属性共享身份特定和视觉证据,使得选择性遗忘容易受到残留泄露或旁道性退化的影响;因此,现有的方法在这一设置中表现出不稳定遗忘——保留与遗忘的权衡。为解决这一挑战,我们提出Causal Localization and Retain-Aware Projection(CLRP),一种轻量级的训练-无关框架。CLRP使用激活点对齐来识别导致目标属性泄露的层,然后应用保留-Aware投影,该投影删除目标属性子空间,同时保留相同身份的证据。在多个广泛使用的MLLMs上进行实验,无论其架构和参数规模如何,都展示了CLRP的有效性。
