论文

面向大推理模型的选择性遗忘

Selective Forgetting for Large Reasoning Models

模型训练模型编辑与遗忘

摘要

大型推理模型(LRM)在给出最终答案前会生成结构化的思维链(CoT),这使其特别容易通过中间推理步骤泄露知识。然而,训练数据中版权内容与隐私内容等敏感信息被记忆,引发了伦理与法律层面的担忧。为解决这些问题,选择性遗忘(又称机器遗忘)已成为LRM的一种潜在补救手段。然而,现有遗忘方法主要针对最终答案,可能在遗忘后损害LRM的整体推理能力。此外,直接对整条CoT施加遗忘也可能降低通用推理能力。LRM遗忘的关键挑战在于,在精确遗忘目标知识的同时保持通用推理能力的完整性。为弥合这一差距,我们在本文中提出一种新颖的LRM遗忘框架,选择性地移除敏感推理成分,同时保留通用推理能力。我们的方法利用多个LLM结合检索增强生成(RAG)分析CoT轨迹,识别与遗忘目标相关的片段,并用保持逻辑结构的良性占位内容替换它们。我们还为LRM引入了一种新的特征替换遗忘损失,能够同时抑制生成被遗忘内容的概率,并强化结构上有效的替换内容。在合成数据集与医疗数据集上的大量实验验证了所提方法的预期性质。

面向大型推理模型的选择性遗忘:论文配图
(a) 原图(b) R2MU(c) FRUL(我们的)图 5:在 R-TOFU 基准上,Reasoning-Llama-3.2-1B 在以 5%%\% 的遗忘率进行遗忘之前和之后的性能比较。 (a) 在完整的 R-TOFU 训练集上微调的基线模型; (b) 使用 R2MU 方法未学习的模型; (c) 使用建议的 FRUL 损失来学习模型。