论文
重播重要的事情:离策略 重播以实现高效的 LLM 强化遗忘
Replay What Matters: Off-Policy Replay for Efficient LLM Reinforcement Unlearning
摘要
LLM 遗忘已成为完全再训练的一种经济有效的替代方案,用于从预训练模型中删除危险知识,同时保留通用性。最近基于强化学习的方法(例如 RULE)将忘却重新表述为学习拒绝行为,但它们的 同策略 优化在整个训练过程中重复从相同的忘记和保留/边界提示中进行采样。我们发现了这个过程中的一个关键的低效率问题:简单的情况很快收敛并提供很少有用的梯度信号,而靠近忘记/保留边界的困难的情况继续产生低回报的采样轨迹,这些采样轨迹在单次使用后被丢弃。为了解决这个问题,我们提出了 ReRULE,一种用于强化取消学习的 离策略 重放增强功能。 ReRULE 在早期 GRPO 训练期间将低奖励硬案例采样轨迹组存储在重播缓冲区中,并在后期通过重要性采样的 离策略 更新重用它们,将计算重定向到仍需要学习的边界情况。从理论上讲,我们表明 ReRULE 比纯 同策略 RULE 产生更严格的硬情况收敛界限。根据经验,ReRULE 将 MUSE-Books 保留质量从 46.3 提高到 56.2,同时跨基准仅增加 5--11% 的训练时间。它对更简单的 TOFU 设置的有限改进进一步支持了预期的条件行为:当困难/简单差异明显时,重播是最有益的。