论文

混合专家语言模型中机器遗忘的路由感知专家校准

Routing-Aware Expert Calibration for Machine Unlearning in Mixture-of-Experts Language Models

模型训练模型架构MoE模型编辑与遗忘

摘要

机器取消学习对于 大语言模型 来说越来越重要,但专家混合 (MoE) 架构中的取消学习仍未得到充分探索。与密集模型不同,MoE 架构在每一层都使用一个路由器,将每个词元分配给稀疏的专家子集。在这项工作中,我们观察到,遗忘数据通常会不成比例地激活一小部分专家,而这些专家可能会从保留数据中获得较弱的激活。这种遗忘-保留路由不匹配可能会导致遗忘关键型专家在遗忘过程中得不到正规化。为了解决这个问题,我们提出 \textbf{TRACE},即有针对性的路由感知专家校准,用于 MoE 的忘却。 TRACE 首先从离线激活统计中检测遗忘关键专家,然后通过重新加权 词元级 保留损失来校准保留正则化,以便每个选定专家的保留侧激活频率更好地匹配其遗忘侧对应项。在多个 MoE LLM 上对 WMDP 和 MUSE-BOOKS 进行的实验表明,TRACE 持续改进了遗忘与效用的权衡,在可比较的遗忘质量下,与最强基线相比,相对效用提高了 9%,并且在四分之三的 MUSE-BOOKS 指标中表现最佳。