论文

DistMoE:用于分布式指令调优的专家混合中的私有数据免演练路由

DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning

摘要

多模态 大语言模型 (MLLM) 已表现出强大的多模态指令跟踪能力,但将其适应不同的视觉语言领域通常需要集中的数据访问和昂贵的联合训练。当数据跨私有、特定于域或权限受限的客户端分发时,这是限制性的。为此,我们提出了 DistMoE,一种用于分布式视觉指令调整的专家混合 (MoE) 方法。在语言解码器的每一层中,它都通过特定于客户端的私有 FFN 专家来增强公共前馈网络 (FFN),其目标是获取特定领域的知识。然而,独立的专家训练导致私人 FFN 学习不同规模和幅度的表示,使得专家合并变得困难。为了减少特定于客户端的漂移,我们引入了一个公共锚定的专家合成阶段,该阶段通过各向同性正则化损失,仅更新本地客户端数据和公共数据混合上的路由器和轻量级私有投影适配器,从而使其成为跨客户端的免排演合成。在推理过程中,DistMoE 在公共和私人专家上执行模块化路由,从而无需显式域标签即可实现词元式域组合。跨不同视觉语言基准的实验表明,DistMoE 能够实现灵活的专家重用、有效的领域适应和竞争性能,同时保留对客户特定知识的模块化控制。代码可在 https://github.com/mainaksingha01/DistMoE 获取。