论文
用于参数化知识注入的解耦专家混合
Decoupled Mixture-of-Experts for Parametric Knowledge Injection
摘要
知识注入旨在为 大语言模型 (LLM) 配备外部、特定领域或时间敏感的知识。现有方法通常面临灵活性和集成性之间的权衡:检索增强生成将知识保留在模型之外,但仅提供即时级别的增强,而基于 后训练 的方法将新知识编码到共享参数中,但可能会引入灾难性遗忘、知识冲突和昂贵的更新。在本文中,我们提出了解耦专家混合(DMoE),这是一种用于参数化知识注入的模块化架构,它将专家和路由器与基本模型解耦。 DMoE将外部知识语料库转换为可独立更新的专家模块,并使用轻量级不确定性感知路由器仅在生成过程中基础模型缺乏足够知识时激活相关专家。为了支持高效的自回归推理,DMoE 仅将专家附加到最后一层前馈网络,保留 KV 缓存重用,同时实现参数级知识增强。知识密集型基准实验表明,与检索和基于适配器的基准相比,DMoE 持续提高了答案质量。