论文
学习要忘记什么:LLM 表示空间的分布式遗忘
Learning What to Forget: Distributional Unlearning for LLM Representation Spaces
摘要
机器学习系统越来越需要消除整个数据域的影响,例如有毒语言、有害行为或话题内容,而不是孤立的记录。最近的工作将这个问题形式化为 \emph{分布遗忘}:选择遗忘域的子集,将其删除使训练分布远离不需要的群体,同时保持与所需群体的接近。然而,现有的分析经常强加参数假设以获得易于处理的选择规则。这些假设可能不太适合高维语言模型表示。我们引入了 \textsc{Mamushi},一个非参数分布遗忘学习的框架,它使用概率分类器对遗忘示例进行排序,该概率分类器的贝叶斯最优 logit 等于遗忘保留对数密度比(最多可达加性类先验常数)。我们证明,对种群对数密度比进行阈值化可以为我们的去除保留目标产生最佳的固定预算选择规则,并建立一个将分数估计和阈值校准误差与种群最优选择规则的退化相关联的非渐近转移保证。我们的实证评估涵盖了使用不同表示的有毒语言删除和主题域删除机制的真实数据集,其中 \textsc{Mamushi} 实现了比其他基线更有利的删除-保留权衡。我们的工作表明 \textsc{Mamushi} 可以作为下游机器遗忘过程的有效选择方法,减少达到固定遗忘目标所需的遗忘示例的数量。