论文
从专家到次专家:MoE LLM 的细粒度参数高效微调
From Experts to Sub-experts: Fine-grained Parameter-Efficient Fine-Tuning for MoE LLMs
摘要
随着大型语言模型 (LLM) 的迅速扩展,密集的全参数自适应变得越来越昂贵,从而激发了稀疏和模块化架构,例如专家混合 (MoE) 模型。这种转变提出了参数高效微调(PEFT)的一个关键问题:应该以什么粒度选择和更新参数?现有的 PEFT 方法(例如 LoRA)在预定义的权重矩阵上运行,而专家级稀疏调整方法则更新整个选定的专家。然而,我们观察到激活的专家内部稀疏,只有一小部分中间通道强烈响应下游任务,这表明专家级适应仍然过于粗糙。我们提出 NSFT(神经子专家微调),这是一个细粒度的 PEFT 框架,可将 MoE 适应从专家改进为子专家。 NSFT 将每个专家沿着中间维度分解为结构化通道组,并通过将路由重要性与专家内激活显着性相结合来选择与任务相关的子专家。为了优化稀疏部分更新,NSFT 进一步引入了学习率缩放和动态梯度缩放来补偿有效更新幅度的降低。在 OLMoE 和 Ling-mini-2.0 上跨具有挑战性的特定领域任务和通用基准的实验表明,NSFT 始终优于代表性 PEFT 和专家级稀疏调整基线,同时使用更少的可训练参数并保持有竞争力的通用能力。这些结果表明,对于教育部大语言模型来说,次专家级适应是一种更精确、更有效的 PEFT 范式。