论文
解耦视觉处理:通过特定模态 Transformer 替换实现高效多模态适应
Decoupled Visual Processing: Efficient Multimodal Adaptation via Modality-Specific Transformer Substitution
摘要
多模态 大语言模型 (MLLM) 通过将视觉和文本理解集成到统一的 Transformer 架构中,展示了卓越的功能。然而,微调 这些用于视觉指令调整的模型的所有参数在计算上是昂贵的并且通常是不必要的,因为视觉和文本标记的表示要求在网络的更深层中存在显着差异。在本文中,我们提出了解耦视觉处理(DVP),这是一种高效的训练框架,用专门用于视觉词元处理的轻量级、可独立训练的单个 Transformer 块取代了预训练 LLM 的上解码器层。具体来说,在通过前半部分解码器层进行共享处理后,视觉和文本词元被分开:视觉词元通过新初始化的单个 Transformer 块进行路由,而文本词元继续通过原始冻结的解码器层。然后,这两个流在语言建模头之前连接起来。在训练期间,仅更新单个 Transformer 块,从而大大减少了可训练参数的数量。 LLaVA-1.5 框架上的实验表明,DVP 在 MME、POPE 和 ChartQA 基准上实现了有竞争力的性能,同时仅训练总参数的一小部分,这表明 MLLM 中的视觉表示可以通过解耦、参数高效的途径有效学习。