论文
MoR-MLLM:以混合递归结构提高多模态大模型效率
MoR-MLLM: Mixture of Recursions for Efficient Multimodal Large Language Models
摘要
多模态大语言模型 (MLLM) 在视觉和语言任务中表现出了卓越的推理能力。然而,它们大量的计算和内存需求阻碍了现实世界的部署。虽然最近的努力通过采用轻量级语言主干来降低成本,但现有范例由于其静态稀疏性和深度分配而仍然是计算密集型的,无法适应每个标记的语义复杂性。为此,我们提出了 MoR-MLLM,这是一种基于最近的混合递归(MoR)框架的计算稀疏 MLLM。 MoR-MLLM 引入了自适应每个标记递归,允许模型动态调整其递归深度,并将更多计算分配给视觉或语言上具有挑战性的标记,同时跳过较简单标记的冗余操作。为了稳定多模态环境中递归稀疏性的训练,我们进一步设计了三阶段 MoR-Tuning 策略和熵正则化损失以鼓励多样化的路由分布。大量实验表明,与最近先进的微型 MLLM 相比,我们提出的 MoR-MLLM 可以大大减少训练内存和计算复杂度,同时保持各种视觉语言任务的高性能。
