论文
LiME:用于高效多模式多任务学习的轻量级专家组合
LiME: Lightweight Mixture of Experts for Efficient Multimodal Multi-task Learning
摘要
MoE-PEFT 方法将专家混合与参数高效的 微调 相结合,以实现多任务适应,但每个专家需要单独的适配器,导致可训练参数随专家数量线性扩展,并限制了基于适配器的架构的适用性。我们提出了LiME(专家的轻量级混合),它通过轻量级调制而不是适配器复制来实现专家专业化。 LiME 没有使用单独的适配器,而是使用单个共享 PEFT 模块,并使用轻量级专家向量调制其输出,减少专家参数,同时推广到任何 PEFT 方法。值得注意的是,LiME 通过利用现有的冻结和自适应表示来引入零参数路由,消除了每层通常需要的学习路由器参数。从理论上讲,我们证明了(i)更多的专家保留了更多与任务相关的信息,(ii)调制近似于具有有限误差的完全专家特定的 PEFT。 LiME 进一步结合了 n-gram 窗口路由和基于路由置信度的自适应专家选择 (Auto Top-K)。 MMT-47 是一个多模态多任务基准测试,包含 47 个任务,涵盖文本、图像和视频,实验表明,与相应的 MoE-PEFT 基准相比,LiME 实现了有竞争力或卓越的性能,同时使用的可训练参数减少了 4 倍,训练速度提高了 29%。