论文

通过多目标强化学习迈向可靠、可泛化且具体的上下文知识编辑

Towards Reliable, Generalizable, and Specific In-Context Knowledge Editing via Multi-Objective Reinforcement Learning

模型训练上下文与知识模型编辑与遗忘上下文工程

摘要

大语言模型(LLM)强大但受限于静态参数知识——预训练结束即会过时。知识编辑通过更新模型在目标事实上的行为而无需完整再训练来解决这个问题。特别是,上下文知识编辑因其无需训练且易于应用于黑盒LLM而受到关注。最近的强化学习(RL)方法通过使提示构建适应数量-质量权衡,改进了固定检索策略。尽管取得初步成功,它们未能将提示建模为一个结构化实体并纳入可靠性、通用性和特异性这些不同且往往相互竞争的目标。先前方法大多只优化单一目标,且只在提示构建过程的一部分上做决策,因而既忽视不同目标的平衡,也忽视示例的全局组织。我们提出多目标上下文知识编辑(MO-IKE),一种将上下文知识编辑的提示构建形式化为受约束马尔可夫决策过程的多目标RL算法。MO-IKE训练一个动态检索器来优化知识编辑中的竞争目标,实现更平衡且全局连贯的提示构建。在Llama-3.2上,MO-IKE将编辑成功率(可靠性)从85.0%提高到92.0%,改写一致性(通用性)从77%提高到79%,同时留存率(特异性)相比先前RL方法提高23.0%。

通过多目标强化学习迈向可靠、可泛化且具体的上下文知识编辑:论文配图
图1:IKE中提示构建的可靠性与特异性目标相互冲突——增加RETAIN演示的数量导致保留成功但编辑失败。