论文

GUARD:通过引导式答案-推理蒸馏实现大型推理模型的自然遗忘

GUARD: Natural Forgetting in Large Reasoning Models via Guided Answer-Reasoning Distillation

模型训练模型编辑与遗忘

摘要

大推理模型(LRM)的近期进展使机器遗忘更具挑战:受保护的事实或不安全的推理内容,可能在最终答案生成前出现在中间思维链(CoT)中。现有遗忘目标通常抑制目标内容或改变内部表示,却没有规定遗忘后的轨迹应如何继续,这可能产生虚构的替代内容、错误的边界或重复输出。我们认为,LRM 遗忘应学习自然的遗忘轨迹:以连贯且不泄露信息的思维链,以及稳定的拒绝式答案,替代原有泄露内容。为此,我们提出引导式答案与推理蒸馏(GUARD),将模型生成的不安全泄露转化为安全退出轨迹,通过引导 Token 对齐冻结的 LRM,再将引导后的行为蒸馏到模型参数中。为弥补现有指标对泄露之外的替代质量衡量不足,我们进一步引入自然遗忘推理分数(NFRS),衡量遗忘输出的结构稳定性、流畅性和无依据的替代内容。在 R-TOFU 和基于 STAR-1 的有害意图场景中,大量实验表明,GUARD 在两个广泛采用的蒸馏 LRM 上显著减少不安全和隐私泄露,同时保持推理效用。代码见 https://github.com/zeyu-Yan/GUARD 。

GUARD:通过引导式答案-推理蒸馏实现大型推理模型的自然遗忘:论文配图
图 3:GUARD 概览。模型生成的披露轨迹被改写为自然的遗忘目标,在冻结的 LRM 上与紧凑的引导 token 对齐,并蒸馏为可部署的答案—推理参数。