论文
MoLE:用于互补视觉推理的潜在专家的混合
MoLE: Mixture of Latent Experts for Complementary Visual Reasoning
摘要
潜在视觉推理为视觉语言模型配备了连续的中间状态,可以处理视觉证据,而无需明确的文本推理痕迹或重复的图像操作。然而,现有的方法通常允许多个潜在词元通过共享价值投影访问相同的视觉证据,没有为它们提供提取互补视觉信息的机制;因此,简单地增加潜在预算可能会产生冗余的潜在表示。我们认为,有效的潜在推理应该鼓励不同的潜在标记提取互补的视觉信息,从而充当专门的视觉专家。基于这一见解,我们提出了 MoLE,一种潜在专家混合框架,它控制每个潜在视觉专家观察到的视觉证据以及如何转换该证据。 MoLE 在证据提取过程中隔离潜在视觉专家,并使用专门的潜在摘要专家来聚合潜在视觉专家的补充表示。两阶段训练管道首先迫使视觉证据通过这个潜在路径,然后恢复直接视觉访问,既不需要预定义的专家角色,也不需要中间视觉目标。在五个视觉推理基准中,MoLE 的平均得分为 78.6,比数据匹配的监督微调高 4.9,比相同潜在预算下最强评估的潜在视觉推理基线高 3.6。表征分析显示潜状态相似性较低,视觉注意力更加多样化,而掩盖潜在路径会使平均性能降低 9.2。这些结果表明,专门的潜在计算比仅仅增加潜在词元的数量更有效。