论文

共生-MoE:释放生成与理解之间的协同作用

Symbiotic-MoE: Unlocking the Synergy between Generation and Understanding

摘要

由于严重的梯度冲突,通过图像生成增强大型多模态模型 (LMM) 的能力通常会导致理解任务时发生灾难性遗忘。虽然 Mixture-of-Transformer (MoT) 等现有范式通过结构隔离缓解了这种冲突,但它们从根本上切断了跨模式协同并遭受容量碎片化。在这项工作中,我们提出了 Symbiotic-MoE,这是一个统一的 预训练 框架,它以零参数开销解决了本机多模式专家混合 (MoE) Transformer 架构中的任务干扰。我们首先发现标准的 MoE 调整会导致路由崩溃,其中生成梯度主导了专家的利用。为了解决这个问题,我们引入了模态感知专家解缠,它将专家划分为特定于任务的组,同时利用共享专家作为多模态语义桥梁。至关重要的是,这种设计允许共享专家从生成任务中吸收细粒度的视觉语义,以丰富文本表示。为了优化这一点,我们提出了一种渐进式训练策略,具有差异学习率和早期梯度屏蔽的特点。这种机制不仅可以保护预先训练的知识免受早期波动的影响,而且最终将生成信号转化为建设性的反馈以供理解。大量实验表明,Symbiotic-MoE 实现了快速生成收敛,同时释放了跨模式协同作用,在 MMLU 和 OCRBench 上取得了显着进步,从而增强了内在理解。