论文

RLVR 诱导推理的机制引导选择性遗忘

Mechanism-Guided Selective Unlearning for RLVR-Induced Reasoning

模型训练强化学习模型编辑与遗忘RLVR

摘要

我们提出了 MAST(机制对齐选择性目标),这是一种机制引导的方法,用于忘记 RLVR 引起的推理,其附带损害比标准全参数更新要低得多。在 Qwen2.5-Math-1.5B 和 Qwen3-1.7B-Base 上匹配的 SFT/RLVR 检查点中,SFT 到 RLVR 的增量与 词元级 delta-log-probability 中的 SFT 更新有很大不同,并且全参数梯度上升仅通过损坏保留 MATH 和 GSM8K 来忘记。 MAST 按偏离主能量、更新幅度和遗忘梯度耦合幅度对注意力投影张量进行排序,然后仅更新排名靠前的子集。在主要模型上,MAST 会导致统计上显着的目标遗忘(MATH 遗忘 45/150 至 37/150;McNemar p=0.0078),同时保留 GSM8K (+0.8 pp) 和 MATH 保留 (-0.5 pp)。这一优势在种子、NPO/SimNPO 目标和 Qwen3 中重现,其中 MAST 保留了 GSM8K,而全参数遗忘则使其崩溃。