论文
Open-MMUnlearning:统一多模态语言模型的遗忘与评测
Open-MMUnlearning: Unifying Methods and Evaluation for MLLM Unlearning
摘要
随着多模态大语言模型(MLLM)变得更加强大和广泛部署,对隐私和安全的担忧变得越来越紧迫。机器取消学习提供了一种解决这些问题的方法,即从经过训练的模型中删除指定信息,同时保留不相关的功能。然而,分散的实现和评估协议、不完整的鲁棒性测试以及对度量可靠性的有限理解使得 MLLM 学习的进展难以系统评估。我们推出了 Open-MMUnlearning,这是一个开源、可扩展的框架,通过共享接口和结构化配置集成了目标模型准备、多模态数据处理、取消学习和评估。该框架支持涵盖隐私、安全和版权的五个基准、来自四个模型系列的八个 MLLM 以及十二个遗忘方法。其评估套件联合评估遗忘有效性、保留效用以及模型干预、对抗性输入和成员推理攻击的稳健性。使用通用的评估协议,我们比较了十种代表性的遗忘方法。在此比较中,GD 和 MIP-Editor 并列获得最高总分:GD 实现了最高的遗忘质量,而 MIP-Editor 保留了更多模型实用性。我们进一步引入了一种度量元评估协议,该协议使用受控暴露目标知识的模型来测试忠实度以及量化和重新学习下的鲁棒性。在 13 个评估指标中,BLEU 获得了最高的总体可靠性得分。 KS-Test 获得了最高的忠实度 AUC,但在鲁棒性方面表现较差。该框架和这些发现共同支持 MLLM 遗忘方法的可重复比较和评估可靠性的系统评估。
