论文
通过稀疏自动编码器进行测试时取消学习
Test-Time Unlearning via Sparse Autoencoder
摘要
机器取消学习旨在从经过训练的大型语言模型(LLM)中删除特定知识,而无需从头开始重新训练。现有方法通过梯度上升及其进步来修改模型权重。虽然在某些基准上有效,但这些基于权重的方法表现出尖锐的遗忘与效用权衡,其中对目标知识的更强遗忘会降低模型的效用,并且在遗忘后微调或即时攻击下,未学习的知识可能会重新出现。我们提出了 ARIA(自动编码器门控推理时取消学习),这是一种测试时取消学习方法,可以保持模型权重完整,并且仅当生成进入遗忘相关状态时才可以访问不需要的知识。 ARIA 使用稀疏自动编码器 (SAE) 潜伏来训练轻量级线性检测器,然后对触发状态应用可解释的干预,测试时间开销可以忽略不计。对 TOFU、R-TOFU 和 WMDP 的实证评估表明,ARIA 在思维模型 (DeepSeek-R1-Distilled-Qwen-1.5B) 和指令模型 (Gemma-3-1B-it) 上改善了基于权重的基线的遗忘-保留权衡,例如,显着降低了 WMDP 网络遗忘集准确性,同时将 MMLU 保持在遗忘前模型的 1% 之内。我们进一步介绍了三种针对权重空间和解码空间恢复的遗忘后对抗性攻击,并发现 ARIA 在这三种情况下仍然保持稳健,在攻击下遗忘变化不到 1%。利用 ARIA 可解释性的特征级案例研究表明,某些保留退化可能反映了遗忘数据背后的响应风格,而不是目标知识本身的泄漏,这凸显了遗忘任务构建中潜在的偏差来源。