论文

掩蔽扩散语言模型的机器取消学习

Machine Unlearning for Masked Diffusion Language Models

模型训练模型编辑与遗忘

摘要

最近的掩蔽扩散语言模型 (MDLM),例如 LLaDA 和 Dream,已经取得了与自回归 大语言模型 相当的性能。与顺序生成文本的自回归模型不同,MDLM 通过并行迭代对屏蔽位置进行去噪来生成文本。在 微调 期间,MDLM 学习从以提示为条件的屏蔽响应状态中恢复响应,从而将其预测从提示屏蔽无条件分布转变为提示条件分布。尽管存在这种独特的生成机制和 微调 机制,但 MDLM 的机器取消学习在很大程度上仍未被探索。在本文中,我们通过重新审视学习扩散方面的特定知识的过程,提出了 Masked Diffusion Unlearning (MDU),这是第一个 MDLM 的去学习框架。具体来说,MDU 最小化从提示条件预测到每个屏蔽响应位置处的提示屏蔽无条件锚点的前向 KL 散度,并使用温度缩放参数来控制隐私-实用性权衡。我们在标准基准和 MDLM 主干上的实证结果表明,与现有的 LLM 取消学习方法相比,MDU 实现了较高的取消学习性能。代码可在 https://github.com/leegeoru/MDU 获取。