论文

晚层融合足矣:视觉饱和下多模态大语言模型的双路径视觉token路由

Late-Layer Fusion is Enough: Dual-Path Vision Token Routing for Multimodal Large Language Models under Visual Saturation

模型架构Transformer

摘要

多模态大语言模型 (MLLM) 通常继承专为单模态文本建模而设计的深层对称 Transformer 主干,并将相同的计算统一应用于图像和语言标记。这种设计忽略了一个关键的模态不对称性:图像和文本标记在信息密度、冗余和所需的推理深度方面存在很大差异。通过对 LLaVA-1.5 的分层分析,我们观察到视觉令牌倾向于在中间层饱和。具体来说,文本到图像的注意力从第 0 层的 0.68 下降到第 4 层的 0.07,并在第 18 层之后稳定在 0.04 附近,而文本标记继续受益于深度语义处理。这些发现表明架构对称性和深度异步模态演化之间存在不匹配,导致冗余视觉计算以及在深度特定任务适应过程中感知表征可能出现的漂移。受此启发,我们提出了双路径视觉令牌路由(DPVR),这是一种用于高效 MLLM 的模态非对称路由框架。其核心实例化 DPVR-LF(后层融合)将饱和点处的视觉标记路由到单层可训练侧分支,运行十三层纯文本前向,跳过深堆栈中的图像位置,并仅在最后一层重新融合视觉和文本流。凭借大约 3% 的可训练参数,DPVR-LF 在标准基准上保留了具有竞争力的多模态性能,同时减少了深度 Transformer 堆栈中的视觉计算。结果挑战了视觉标记必须遍历所有深层语言模型层的传统假设,并表明单个后期融合层足以在 LLaVA 式 MLLM 中保持强大的感知能力。