论文

LLM 的 CPR:针对域适应中的灾难性遗忘的关键点路由

CPR for LLMs: Critical-Point Routing against Catastrophic Forgetting in Domain Adaptation

摘要

有监督的 微调 (SFT) 是使 大语言模型 (LLM) 适应目标领域的事实标准,但它经常会降低模型的一般能力,这种现象称为灾难性遗忘。现有方法通常会修改 SFT 损失以减轻遗忘,但它们不可避免地会在领域通用性权衡中发挥作用。在这项工作中,我们通过在模型级别解耦这两种功能来摆脱这种权衡:我们保留通用功能的原始基础模型,并仅在需要特定领域知识时有选择地调用 SFT 专家。具体来说,我们提出了 CPR(关键点路由),这是基本模型与其专家衍生品之间的 词元级 路由框架,基于基本模型失败但专家成功的关键标记。我们训练一个轻量级分层路由器,估计每个词元的专家调用概率,并将其与结合动量平滑和阈值门控的定制推理程序配对。在不同的模型域配置中,CPR 在所有设置上都达到了最先进的水平,在域性能方面超越了 SFT 专家 1.4-5.5%,同时将其一般能力下降从 3.4-14.5% 恢复到最多 0.5%,仅在三分之一的词元上调用专家的开销最小。