论文

$μ^2$-Bench:多语言机器学习基准

$μ^2$-Bench: A Multilingual Machine Unlearning Benchmark

模型评测基准与评测资源

摘要

有害内容和私人数据等不良信息通过多语言大语言模型 (LLM) 通过直接训练和间接跨语言传播进行传播。多语言机器取消学习(MMU)旨在消除此类信息,但其评估仍未得到充分探索,尚不清楚取消学习是否真正消除了所有语言的目标知识。为了弥补这一差距,我们引入了 $\mu^2$-Bench,这是一个 MMU 基准测试,可以模拟跨不同语言的记忆、遗忘和评估的完整流程。它 1) 涵盖广泛的语言,2) 对训练语言和保留语言进行评估,3) 评估分散在多种语言中的知识。我们表明,成功的 MMU 需要反映多语言特征的方法,并进行分析以提供对 MMU 的更深入见解。