论文

LLM 中的多语言忘却:迁移、动态和可逆性

Multilingual Unlearning in LLMs: Transfer, Dynamics, and Reversibility

模型训练模型编辑与遗忘

摘要

大语言模型 (LLM) 可以记住敏感事实,激发忘却方法,无需昂贵的再培训即可删除目标知识。然而,遗忘研究仍然主要以英语为中心。我们通过将 TOFU 基准扩展到五种语言来研究多语言遗忘,并使用不同的语言排列来微调、遗忘和查询我们的模型。我们发现,未学习迁移,即未学习模型“忘记”非学习语言中的事实的能力,是高度可变的:例如,在共享脚本和家族的语言之间最强,并且我们表明,未学习语言预测哪些查询语言最有可能产生最强的迁移。逐层分析表明,遗忘使早期层中共享的跨语言潜在空间基本完好无损,而主要在后面的解码层中运行。这表明忘却并没有真正消除知识,而是导致表面的压抑。利用这种结构,单个推理时间转向方向逆转了跨语言的大部分抑制,恢复了 50% (Qwen) 和 90% (Gemma) 的未学知识。