论文
CiPO:通过迭代偏好优化大型推理模型的反事实遗忘
CiPO: Counterfactual Unlearning for Large Reasoning Models through Iterative Preference Optimization
摘要
近年来,机器取消学习作为一种很有前途的技术,可以选择性地从经过大规模人类数据训练的 大语言模型 中删除不需要的隐私或受版权保护的信息,因此受到越来越多的关注。然而,强调长链思维(CoT)推理来解决复杂问题的大型推理模型(LRM)的出现,给遗忘带来了困境:现有方法要么难以从CoT痕迹中完全消除不需要的知识,要么由于推理过程受到干扰而降低推理性能。为此,我们通过迭代偏好优化(CiPO)引入了反事实遗忘,这是一个新颖的框架,它将遗忘重新定义为 LRM 中 CoT 推理的有针对性的干预。更具体地说,给定所需的不学习目标答案,CiPO 指示 LRM 生成逻辑上有效的反事实推理轨迹以进行偏好调整。随着 LRM 适应反事实轨迹,CiPO 迭代更新偏好学习数据,以增加与原始模型的差异。这种迭代循环确保了理想的遗忘和平滑的优化,有效地缓解了困境。在具有挑战性的基准上进行的实验表明,CiPO 擅长忘却学习,完全消除中间 CoT 步骤和最终答案中的知识,同时保留 LRM 的推理能力。