论文

DR-LoRA:用于专家混合适应的动态排名 LoRA

DR-LoRA: Dynamic Rank LoRA for Mixture-of-Experts Adaptation

模型训练模型架构MoE参数高效训练

摘要

专家混合 (MoE) 已成为扩展大语言模型 (LLM) 的重要范例。 LoRA 等参数高效微调 (PEFT) 被广泛采用,使预训练的 MoE LLM 适应下游任务。然而,现有方法为所有专家分配相同的 LoRA 等级,忽视了 MoE LLM 内在的功能专业化。这种统一分配导致资源不匹配,与任务相关的专家配置不足,而相关性较低的专家则收到冗余参数。我们提出了一个名为 DR-LoRA 的动态排名 LoRA 框架,它可以根据特定任务的需求在微调过程中动态增长专家 LoRA 排名。 DR-LoRA 采用专家显着性评分机制,该机制集成了专家路由频率和 LoRA 排名重要性,以量化每个专家对额外容量的需求。具有较高显着性分数的专家优先进行排名扩展,从而能够自动形成适合目标任务的异构排名分布。多个基准测试的实验表明,在相同的参数预算下,DR-LoRA 始终优于标准 LoRA 和静态分配策略,通过更高效的参数利用实现卓越的任务性能。

DR-LoRA:用于微调混合专家模型的动态秩LoRA 配图
图 1:DR-LoRA 框架概览。预训练专家权重被冻结,而每个专家都配备一个可训练的 LoRA 模块。这些模块以较小的初始秩(r_init)起步,并可在训练期间动态增长(Δr)。专家显著性评分(Expert Saliency Scoring)整合两个实时信号来引导秩的增长:(1) 专家路由频率(f_i),从路由器的决策中追踪以衡量任务相关性;(2) LoRA 秩重要性(g_i),由可训练 LoRA 矩阵(A 与 B)的梯度信号推导而来,用于衡量学习强度。