论文

用头控金丝雀忘记学习后审计推理跟踪记忆声明

Auditing Reasoning-Trace Memorization Claims after Unlearning with Head-Conditioned Canaries

模型评测评测方法与指标

摘要

对推理模型遗忘的评估有时会显示出旁路模式。答案面看起来没有学过,但模型自身的思维轨迹不断发出遗忘的内容,而差距则被视为权重仍然记得的证据。我们在 DeepSeek-R1-Distill-Qwen-7B 上审核了这一阅读,其中包括 LoRA 记忆的虚构作者和 NPO 遗忘,以六词元金丝雀头为条件。在一颗种子上,将思维轨迹替换为相同权重上的短非金丝雀预填充会导致答案率下降,其幅度与旁路间隙本身一样多,无论预填充是否模仿训练模板。在第二颗种子上,旁路间隙缩小而不是消失,预填充交换反转方向并将答案率提高到上限。因此,正的解析器分割旁路间隙本身并不能识别隐藏的权重级别记忆,也不能排除它。在不同的馏出物上,相同的度量翻转符号,因为解析器找不到结束标记。我们建议将解码时模板交换作为与规范审计一起进行的廉价健全性检查。