论文

忘却时要忘记什么?忘记语言模型的设置管理

What to Forget in Unlearning? Forget Set Curation for Language Models

模型评测基准与评测资源

摘要

机器取消学习旨在从训练模型中删除目标数据或行为,而无需从头开始重新训练。然而大多数评估都假设要忘记的例子是已知的。在现实的语言模型部署中,请求者可能会要求模型停止复制歌曲或书籍,而不知道万亿词元语料库中的哪些跨度、文档、引文或近乎重复的内容支持该行为。我们研究这个缺失的上游问题,忘记设置管理:将抑制请求映射到传递给不学习算法的数据。我们推出 CleanSlate,这是对歌曲和书籍进行逐字输出抑制的基准,具有特定于模型的提取配置文件、基于内容的 QA 和能力保留评估。 CleanSlate 公开了两种故障模式。自然词汇和精确子串管理者通常会产生导致弱抑制的遗忘集。具有评估意识的管理者几乎完全抑制请求的延续,但会导致非请求内容的附带回归和模型相关的能力损失。这些结果表明,一旦给出了遗忘集,实际的遗忘不仅仅是一个优化问题:选择用于遗忘的数据决定了哪些内容可以被遗忘,哪些内容会被损坏。