论文
忘记重要的,保留其余的:选择性忘记信息标记
Forget What Matters, Keep the Rest: Selective Unlearning of Informative Tokens
摘要
大语言模型 (LLM) 中的忘却已成为对抗对抗行为的一种有前景的防护措施。当统一应用遗忘损失而不考虑 词元级 语义重要性时,模型效用可能会不必要地降低。最近的研究探索了 token-wise 损失正则化器,这些正则化器优先考虑信息标记,但很大程度上依赖于 真值 置信度或外部语言解析器,这限制了它们捕获上下文信息或模型整体预测状态的能力。直观上,像“the”这样的功能词主要起到句法作用,并且具有高度可预测性,几乎没有歧义,但信息性词允许多种看似合理的替代方案,但不确定性更大。基于这种直觉,我们提出了熵引导词元加权(ETW),这是一种 词元级 不学习正则化器,它使用预测分布的熵作为词元信息性的代理。我们证明信息性标记往往具有较高的熵,而结构性标记往往具有较低的熵。与现有的 词元级 方法相比,这种行为使 ETW 能够实现更有效的遗忘,同时更好地保留模型效用。