论文

Mixture of Layers:面向视觉推理的动态层路由

Mixture of Layers: Dynamic Layer Routing for Visual Reasoning

模型架构模型推理应用与实践混合架构推理策略与问题分解通用理解与问答

摘要

预训练的视觉编码器包含在空间粒度、语义抽象和对局部细节的敏感性方面不同的分层视觉表示。然而,大多数多模态大型语言模型(MLLM)仅依赖于最终或倒数第二个视觉编码器表示或固定聚合规则,使得视觉抽象在很大程度上与查询无关,并限制对细粒度线索的访问,例如小对象、空间细节、文本和微妙的视觉属性。在这项工作中,我们提出了混合层(MoL),这是一种视觉补丁级别的指令条件层路由方法,它动态聚合来自中间视觉编码器层的与查询相关的潜在表示。给定文本查询,MoL 预测视觉编码器层上的路由概率,并在图像级别、补丁级别或通过混合路由机制对选定的隐藏状态执行 top-k 稀疏聚合。在此过程中,MoL 能够对特定于层的视觉特征进行查询自适应访问,以进行细粒度的视觉推理。我们的实验涵盖 7 个细粒度 视觉推理任务表现出显着的性能改进,特别是在细粒度视觉基础和理解任务中,例如与基线 MLLM 相比,V* 的整体准确度提高了 18.9%,HRBench4K 提高了 4.5%,CharXiv 提高了 16.3%,而无需求助于多分辨率输入、多个视觉编码器的简单交错或增加补丁标记的数量。我们研究视觉编码器跨不同层的感受野尺度及其采样行为,以深入分析分层采样为何有用,证明条件视觉表示是 MLLM 中实现更好的视觉感知和推理的关键一步。我们的项目页面可在https://wjdghks950.github.io/mol.github.io/。上找到

Mixture of Layers:面向视觉推理的动态层路由:论文原图
图 1:层混合概述。该图说明了细粒度视觉推理场景,其中 MLLM 应基于准确捕获与查询相关的视觉特征的视觉表示来进行推理。 MoL 可以分为三个互补的变体:(i)MoLlayer,在输入图像上生成查询引导的(t¯\bar{t})层级概率分布; (ii) MoLpatch,它为每个视觉补丁生成一个查询引导的层分布; (iii) MoLhybrid,测量 MoLlayer 和 MoLpatch 之间的差异,并将门控权重分配给保留层(第 3.1 节)表示,随后通过加权线性组合推动形成最终的补丁嵌入序列。为了简洁起见,我们省略了一些箭头(例如,到 LLM 主干的文本查询)。