论文

科学论断能从大语言模型中移除吗?论断级机器遗忘的系统性评估

Can Scientific Claims Be Removed from Large Language Models? A Systematic Evaluation of Claim-Level Unlearning

模型评测基准与评测资源

摘要

语言模型(LM)在静态科学语料上训练,而科学知识通过更正与修订持续演化。编码于这些模型中的科学论断随后可能被撤回、证伪或被后续研究更新,带来在科学工作流中传播过时信息的风险。这要求语言模型能够遗忘过时的科学论断。机器遗忘提供了一种有前景的方案:在移除知识的同时保持模型整体效用。现有研究主要考察实例级遗忘;然而,科学论断因其相互关联且持续演化而带来额外挑战。为填补这一空白,我们提出科学论断遗忘任务,并发布新基准SciUnlearn。我们表明,当前遗忘方法无法有效消除论断级知识,往往只实现表面抑制,凸显了对面向结构化知识移除的专门方法的需求。

科学论断能从大语言模型中移除吗?论断级机器遗忘的系统性评估:论文配图
图1:SciUnlearn 数据集生成流程。