论文
忘却重要的事情:词元级 精确语言模型忘却的归因
Unlearning What Matters: Token-Level Attribution for Precise Language Model Unlearning
摘要
机器取消学习已成为解决 大语言模型 (LLM) 中隐私、安全和监管问题的关键功能。现有方法在序列级别上运行,对所有标记应用统一更新,尽管只有一个子集编码了要删除的知识。这会引入梯度噪声,降低实用性,并导致次优遗忘。我们提出了 TokenUnlearn,这是一个 词元级 归因框架,可以识别并选择性地定位关键词元。我们的方法通过掩蔽结合了知识感知信号和熵感知信号,以产生精确标记选择的重要性分数。我们开发了两种互补策略:硬选择,仅对高重要性标记应用取消学习,以及软加权,根据重要性分数调整梯度贡献。两者都将现有方法扩展到 词元级 变体。理论分析表明,词元级 的选择提高了梯度信噪比。跨三种模型架构的 TOFU 和 WMDP 基准实验表明,在遗忘有效性和效用保留方面,序列级基线均得到了一致的改进。