论文
HiEdit:使用分层强化学习进行终身模型编辑
HiEdit: Lifelong Model Editing with Hierarchical Reinforcement Learning
摘要
终身模型编辑 (LME) 旨在按顺序纠正已部署的 LLM 中过时或不准确的知识,同时最大限度地减少对不相关输入的副作用。然而,现有方法通常将参数扰动应用于所有编辑实例的静态且密集的 LLM 层集。这种做法是违反直觉的,因为我们假设不同的知识存储在模型的不同层中。忽视这种分层特异性可能会妨碍整合新知识的适应性,并导致一般知识和先前编辑的知识的灾难性遗忘。为了解决这个问题,我们提出了 HiEdit,这是一种分层强化学习框架,可以自适应地识别每个编辑实例与知识最相关的层。通过启用动态的、实例感知的图层选择并结合稀疏性的内在奖励,HiEdit 实现了精确的本地化更新。在各种 LLM 上进行的实验表明,HiEdit 将竞争对手 RLEdit 的性能平均提高了 8.48%,每次编辑仅扰动一半的图层。我们的代码位于:https://github.com/yangfanww/hiedit。