论文
DR-LoRA:用于专家混合适应的动态排名 LoRA
DR-LoRA: Dynamic Rank LoRA for Mixture-of-Experts Adaptation
摘要
专家混合 (MoE) 已成为扩展大语言模型 (LLM) 的重要范例。 LoRA 等参数高效微调 (PEFT) 被广泛采用,使预训练的 MoE LLM 适应下游任务。然而,现有方法为所有专家分配相同的 LoRA 等级,忽视了 MoE LLM 内在的功能专业化。这种统一分配导致资源不匹配,与任务相关的专家配置不足,而相关性较低的专家则收到冗余参数。我们提出了一个名为 DR-LoRA 的动态排名 LoRA 框架,它可以根据特定任务的需求在微调过程中动态增长专家 LoRA 排名。 DR-LoRA 采用专家显着性评分机制,该机制集成了专家路由频率和 LoRA 排名重要性,以量化每个专家对额外容量的需求。具有较高显着性分数的专家优先进行排名扩展,从而能够自动形成适合目标任务的异构排名分布。多个基准测试的实验表明,在相同的参数预算下,DR-LoRA 始终优于标准 LoRA 和静态分配策略,通过更高效的参数利用实现卓越的任务性能。
