论文

ICU-Bench:多模态大语言模型持续遗忘基准

ICU-Bench:Benchmarking Continual Unlearning in Multimodal Large Language Models

模型评测基准与评测资源

摘要

尽管多模态大语言模型(MLLM)在许多领域取得了显着的进展,但它们对大规模多模态数据集的训练引起了严重的隐私问题,使得有效的机器取消学习变得越来越必要。然而,现有的基准主要关注静态或短序列设置,为评估实际部署中的持续隐私删除请求提供有限的支持。为了弥补这一差距,我们引入了 ICU-Bench,这是一个基于隐私关键文档数据的持续多模态忘却基准。 ICU-Bench 包含来自医疗报告和劳动合同两个文档领域的 1,000 个隐私敏感配置文件,其中包含 9,500 张图像、16,000 个问答对和 100 个遗忘任务。此外,还引入了新的持续忘却指标,有助于对整个持续忘却过程中的遗忘有效性、历史遗忘保存、保留效用和稳定性进行全面分析。通过在 ICU-Bench 上对代表性遗忘方法进行大量实验,我们发现现有方法通常在连续环境中陷入困境,并且在平衡遗忘质量、效用保留和长任务序列的可扩展性方面表现出明显的局限性。这些发现强调了需要专门为持续删除隐私而设计的多模态遗忘方法。

ICU-Bench:多模态大语言模型持续遗忘基准
图 1:ICU-Bench 的动机。 (a) 传统的静态忘学习在单个遗忘任务后评估 MLLM,主要衡量目标信息的一次性删除。 (b) 在实际部署中,隐私删除请求通常按顺序到达,要求模型处理重复的遗忘任务,同时保留先前删除的信息和非目标知识。 (c) 长时间持续的遗忘序列暴露了静态评估中难以捕获的故障模式,包括历史遗忘反弹、保留漂移和效用退化。