论文
Mixture of Layers:面向视觉推理的动态层路由
Mixture of Layers: Dynamic Layer Routing for Visual Reasoning
摘要
预训练的视觉编码器包含在空间粒度、语义抽象和对局部细节的敏感性方面不同的分层视觉表示。然而,大多数多模态大型语言模型(MLLM)仅依赖于最终或倒数第二个视觉编码器表示或固定聚合规则,使得视觉抽象在很大程度上与查询无关,并限制对细粒度线索的访问,例如小对象、空间细节、文本和微妙的视觉属性。在这项工作中,我们提出了混合层(MoL),这是一种视觉补丁级别的指令条件层路由方法,它动态聚合来自中间视觉编码器层的与查询相关的潜在表示。给定文本查询,MoL 预测视觉编码器层上的路由概率,并在图像级别、补丁级别或通过混合路由机制对选定的隐藏状态执行 top-k 稀疏聚合。在此过程中,MoL 能够对特定于层的视觉特征进行查询自适应访问,以进行细粒度的视觉推理。我们的实验涵盖 7 个细粒度 视觉推理任务表现出显着的性能改进,特别是在细粒度视觉基础和理解任务中,例如与基线 MLLM 相比,V* 的整体准确度提高了 18.9%,HRBench4K 提高了 4.5%,CharXiv 提高了 16.3%,而无需求助于多分辨率输入、多个视觉编码器的简单交错或增加补丁标记的数量。我们研究视觉编码器跨不同层的感受野尺度及其采样行为,以深入分析分层采样为何有用,证明条件视觉表示是 MLLM 中实现更好的视觉感知和推理的关键一步。我们的项目页面可在https://wjdghks950.github.io/mol.github.io/。上找到
