论文
ConceptGuard:大语言模型 中上下文相关遗忘的基准测试
ConceptGuard: Benchmarking Context-Sensitive Unlearning in Large Language Models
摘要
大语言模型 (LLM) 越来越需要选择性地删除有害或敏感知识,称为遗忘,但现有的方法和基准无法完全评估这种能力。当前的方法依赖于不相交的遗忘和保留由独立事实组成的集合,并使用简单而直接的事实回忆来衡量成功。这种框架未能抓住忘却的关键要求,即消除有害行为同时保留良性和有益知识的能力。我们认为,有效的忘却必须在概念层面上进行,确保完全删除不安全的应用程序,同时保持其正确和有用的用法,从而实现概念上有意义和完全的忘却。为了从实用的角度更好地评估遗忘技术,我们引入了双重用途概念的概念:可以在有害和良性环境中使用的概念。基于这些概念,我们构建了一个名为 ConceptGuard 的基准,其中忘记集和保留集在概念使用中明确互补。我们的基准独特地使得能够在概念层面而不是稀疏事实的层面上探索和衡量遗忘,并且评估是意图敏感的,其目标是最大化上下文分离以促进更安全的行为。我们证明当前的忘却技术在这种情况下表现不佳,表现出较弱的上下文分离以及 ROUGE 和概念级指标的表现不佳。我们的结果揭示了强烈的遗忘与效用权衡、上下文敏感性的收益有限以及跨方法的概念级控制的一致性较差,并为更好地符合现实世界安全要求的遗忘方法提供了想法。我们的数据集是公开的。