论文

MoR-MLLM:以混合递归结构提高多模态大模型效率

MoR-MLLM: Mixture of Recursions for Efficient Multimodal Large Language Models

模型架构模型推理递归架构推理加速

摘要

多模态大语言模型 (MLLM) 在视觉和语言任务中表现出了卓越的推理能力。然而,它们大量的计算和内存需求阻碍了现实世界的部署。虽然最近的努力通过采用轻量级语言主干来降低成本,但现有范例由于其静态稀疏性和深度分配而仍然是计算密集型的,无法适应每个标记的语义复杂性。为此,我们提出了 MoR-MLLM,这是一种基于最近的混合递归(MoR)框架的计算稀疏 MLLM。 MoR-MLLM 引入了自适应每个标记递归,允许模型动态调整其递归深度,并将更多计算分配给视觉或语言上具有挑战性的标记,同时跳过较简单标记的冗余操作。为了稳定多模态环境中递归稀疏性的训练,我们进一步设计了三阶段 MoR-Tuning 策略和熵正则化损失以鼓励多样化的路由分布。大量实验表明,与最近先进的微型 MLLM 相比,我们提出的 MoR-MLLM 可以大大减少训练内存和计算复杂度,同时保持各种视觉语言任务的高性能。

MoR-MLLM:以混合递归结构提高多模态大模型效率:论文原图
图 1:培训框架和策略。 MoR-MLLM采用三阶段协议。第一阶段:投影预热:在此阶段,仅优化 MLP 参数以使 LLM 能够处理视觉输入。第二阶段:路由器预热:我们用初始化的 MoR 块替换选定的 LLM 层,并仅训练 MoR 共享子模块 ℳ⁡(⋅)\mathcal{M}(\cdot) 及其路由器。第三阶段:联合微调:我们解冻所有 Transformer 块、词嵌入模块和 MLP。然后我们与路由器在下游多模式任务上联合对它们进行微调。