论文
学会选择而非重学:硬路由的推理LoRA混合
Learning to Select, Not Relearn: Hard-Routed Mixtures of Reasoning LoRAs
摘要
将独立训练的 LoRA 适配器组合成单个大型语言模型对于多域适应非常有用,特别是当原始训练数据无法共享时。一种常见的方法是在 LoRA 专家上使用 MoE 式路由,但对于冻结的预训练适配器,软加权组合可以改变每个 LoRA 模块最初训练的单位规模加性更新。我们提出了 \textbf{硬路由 MoR-LoRA},这是一个两阶段框架,用于通过单位规模硬选择组成冻结推理 LoRA 专家。首先,使用强化学习从可验证的反馈中独立训练特定领域的 LoRA 适配器,以获得推理专家。然后,所有专家都被冻结,从他们中提取推理痕迹,并且仅训练一个轻量级共享路由器和一个小注意力 LoRA 来进行集成。路由器使用硬顶 1 路由为每个词元精确选择一名专家,而直通估计器则支持基于梯度的训练。跨五个基准、多个模型规模和其他模型系列的实验表明,硬路由 MoR-LoRA 保留了专家行为,同时比软路由混合基线所需的可训练参数少得多。我们的分析进一步表明,归一化的软混合通常将大部分路由质量集中在单个专家上,这表明硬单元规模路由为冻结的 LoRA 专家组合提供了简单而有效的抽象。
