论文

通过基于指令的思维链提示学习编辑知识

Learning to Edit Knowledge via Instruction-based Chain-of-Thought Prompting

模型训练模型编辑与遗忘

摘要

大语言模型(LLM)可以通过知识编辑有效处理过时的信息。然而,当前的方法面临两个关键的局限性:(I)泛化性差:大多数方法严格地注入新知识,而不确保模型能够有效地使用它来解决实际问题。 (II)范围狭窄:当前的方法主要关注结构化事实三元组,忽视了现实世界中普遍存在的各种非结构化形式的事实信息(例如新闻、文章)。为了应对这些挑战,我们提出了一种新的范式:教授 LLM 通过思想链 (CoTs) 推理 (CoT2Edit) 编辑知识。我们首先利用结构化和非结构化编辑数据的语言模型代理来生成 CoT,从而构建高质量的指令数据。然后,该模型经过监督 微调 (SFT) 和组相对策略优化 (GRPO) 进行训练,以对编辑的知识进行推理。在推理时,我们集成检索增强生成(RAG)来动态检索相关编辑的事实以进行实时知识编辑。实验结果表明,我们的方法只需对三种开源语言模型进行一轮训练,即可在六种不同的知识编辑场景中实现强大的泛化能力。这些代码可从 https://github.com/FredJDean/CoT2Edit 获取。