论文
MoEGen:实例自适应 LoRA 生成的专家组合
MoEGen: Mixture-of-Experts for Instance-Adaptive LoRA Generation
摘要
参数高效的 微调 (PEFT) 能够实现 大语言模型 的高效适配,但现有的基于 MoE 的 PEFT 方法通常通过存储多个完整的 LoRA 专家来提高容量,导致适配器存储随专家数量线性增长并将适配限制为固定专家池。我们询问基于 MoE 的 PEFT 是否可以产生特定于实例的适应,而无需为每个专家显式存储单独的 LoRA 模块。为了解决这一差距,我们提出了 MoEGen,这是一种适应框架,它将基于 MoE 的 PEFT 从专家选择转变为专家条件参数生成。 MoEGen 没有将每个专家存储为完整的 LoRA 适配器,而是将每个专家表示为一个小的可学习向量,称为专家代码。它通过这些向量路由每个输入,并使用它们的加权组合来调节轻量级超网络,该超网络生成特定于输入的低秩更新。此设计将专家容量与适配器存储解耦,同时实现实例调节的适应。对八个常识推理基准的实验表明,三个主干网中的强静态和基于 MoE 的 PEFT 基线得到了一致的改进。 MoEGen 在联合医疗和法律领域适应方面也表现强劲。