论文
LLM 遗忘中的语言漏洞:从 174 种语言基准到覆盖范围感知遗忘
Linguistic Loopholes in LLM Unlearning: From a 174-Language Benchmark to Coverage-Aware Unlearning
摘要
用一种语言忘记一个事实并不能保证在其他语言中删除它,因为改变查询甚至所请求的答案语言可以重新打开看似被遗忘的知识——这是一个跨语言的漏洞。应对这一挑战的最直接的解决方案——在所有语言中执行遗忘——既不可扩展也不可取,因为它会放大对不相关模型功能的损害。我们引入了限定语言预算的多语言遗忘的任务,其目标是选择最大化跨语言擦除的语言子集。为了研究这项任务,我们引入了Cross-Lingual Unlearning Tensor,这是一个涵盖 174 个语言脚本对和 25 个原子释义类型的忘却基准,用于检查遗忘何时泛化到相同知识的语言表达上。我们进一步提出了 COVER,它选择源语言来最大化接受无遗忘监督的语言的预测覆盖率,从而能够在有限语言预算下执行遗忘。令人惊讶的是,我们发现天真地选择强大的个体源并不能可靠地组成强大的源集来激励我们开发 COVER。在部署时,COVER 仅需要良好的校准数据和对冻结模型的访问。在三个模型系列和两个不相交的遗忘集中,相对于统一源选择,COVER 将留出语言的平均残余知识访问率减少了 7.8--27.3%。我们发现这些成果超越了合成基准,延伸到了低资源语言环境中的真实新闻文档,使用了来自紧急事件低资源语言 (LORELEI) 语料库的人工翻译数据。