论文

超越二元奖励:强化遗忘奖励设计的比较研究

Beyond Binary Rewards: A Comparative Study of Reward Design for Reinforcement Unlearning

模型训练模型编辑与遗忘

摘要

机器遗忘旨在有选择地从经过训练的语言模型中删除特定知识,而无需进行全面的再训练,这在 GDPR 和欧盟人工智能法案等隐私法规下越来越有必要。最近的工作将忘却重新表述为具有可验证奖励的强化学习(RLVR)问题,其中模型针对直接从其输出计算的可验证奖励进行优化。然而,现有的方法依赖于稀疏的二元奖励,这些奖励提供最小的学习信号,仅指示是否避免了禁止的内容,并限制了收敛速度。在本文中,我们研究了奖励设计如何影响强化遗忘(RUL)框架内的遗忘效率。我们引入了一个原则性的奖励分解框架,将可验证性与稀疏性解耦,并提出了两个新的奖励函数:一个是指数奖励,它根据禁止概念出现的次数提供分级惩罚;另一个是受 PageRank 启发的奖励,它根据语义重要性对惩罚进行加权。我们在现实世界知识遗忘 (RWKU) 基准上进行了实验,证明两种奖励始终优于二元设置,同时达到类似的遗忘性能,速度提高了 3 倍,并保留了一般模型效用。我们的结果表明,奖励设计是消除学习效率的关键驱动因素,为可扩展和高效的机器消除学习提供了一条实用途径。