论文

ParVL:多模态的并行缩放和可扩展计算分配 LLM

ParVL: Parallel Scaling and Expandable Compute Allocation for Multimodal LLMs

模型架构新型架构

摘要

多模态 大语言模型 (MLLM) 的现有扩展策略通常会扩展模型参数或顺序推理计算,从而产生大量内存或延迟开销。更重要的是,大多数现有方法无法改变 Vision Transformer 和 大语言模型 组件之间严格、固定的计算分配,从而限制了特定于任务的优化。为了解决这个问题,我们引入了 MLLM 的并行视觉语言 (ParVL) 扩展框架,该框架通过跨多个视觉和语言分支重用现有的 ViT 和 LLM 主干参数来扩展并行计算。该框架提出了一个核心问题:给定固定的主干参数预算,额外的共享主干计算应如何在视觉和语言模态之间分配?我们在共享主干上使用特定于分支的前缀参数实例化每个并行计算流,并通过全参数监督的 微调 在大约 13B 个词元上端到端地训练整个模型。我们系统地研究了 ViT 编码器和 LLM 解码器之间的计算分配权衡。与相同方法的单分支基线相比,ParVL 提高了整体多模态性能,并且最佳评估的视觉语言分配因任务而异。代码可在 https://github.com/YangYangGirl/ParVL 获取。