论文

学会选择而非重学:硬路由的推理LoRA混合

Learning to Select, Not Relearn: Hard-Routed Mixtures of Reasoning LoRAs

模型架构模型训练MoE强化学习RLVR

摘要

将独立训练的 LoRA 适配器组合成单个大型语言模型对于多域适应非常有用,特别是当原始训练数据无法共享时。一种常见的方法是在 LoRA 专家上使用 MoE 式路由,但对于冻结的预训练适配器,软加权组合可以改变每个 LoRA 模块最初训练的单位规模加性更新。我们提出了 \textbf{硬路由 MoR-LoRA},这是一个两阶段框架,用于通过单位规模硬选择组成冻结推理 LoRA 专家。首先,使用强化学习从可验证的反馈中独立训练特定领域的 LoRA 适配器,以获得推理专家。然后,所有专家都被冻结,从他们中提取推理痕迹,并且仅训练一个轻量级共享路由器和一个小注意力 LoRA 来进行集成。路由器使用硬顶 1 路由为每个词元精确选择一名专家,而直通估计器则支持基于梯度的训练。跨五个基准、多个模型规模和其他模型系列的实验表明,硬路由 MoR-LoRA 保留了专家行为,同时比软路由混合基线所需的可训练参数少得多。我们的分析进一步表明,归一化的软混合通常将大部分路由质量集中在单个专家上,这表明硬单元规模路由为冻结的 LoRA 专家组合提供了简单而有效的抽象。

学会选择而非重学:硬路由的推理LoRA混合:论文配图
图 1:拟议的硬路由 MoR-LoRA 框架概述。该方法遵循两阶段训练流程。第一阶段(左):每个 LoRA 适配器都使用 RLVF 在特定领域进行独立训练,产生一组推理专家。第二阶段(右):所有经过预训练的专家都被集成到一个共享模型中并保持冻结状态。共享轻量级路由器和小型注意力 LoRA 通过对从专家收集的提炼推理轨迹进行监督微调进行训练。在推理过程中,路由器为每个令牌选择一名专家,强制执行单位缩放并保留原始 LoRA 假设。 STE 通过在向后传递期间遵循软概率(虚线箭头),使梯度能够通过离散路由决策传播。