论文
只见不思:多模式专家混合中的路由干扰
Seeing but Not Thinking: Routing Distraction in Multimodal Mixture-of-Experts
摘要
多模态专家混合 (MoE) 模型在视觉语言任务上取得了显着的性能。然而,我们发现了一个令人费解的现象,称为“见而不思”:模型准确地感知图像内容,但在后续推理中失败,同时正确地解决以纯文本形式呈现的相同问题。通过系统分析,我们首先验证了 MoE 架构中存在跨模态语义共享,排除了语义对齐失败作为唯一的解释。然后,我们发现视觉专家和领域专家表现出分层分离,图像输入导致领域专家集中的中间层中的文本输入与文本输入存在显着的路由差异。基于这些发现,我们提出了路由干扰假设:在处理视觉输入时,路由机制无法充分激活与任务相关的推理专家。为了验证这一假设,我们设计了一种路由引导的干预方法,可以增强领域专家的激活。对六个基准的三个多模态 MoE 模型进行的实验显示出持续的改进,在复杂的视觉推理任务上的增益高达 3.17%。我们的分析进一步表明,领域专家识别定位的是认知功能,而不是特定于样本的解决方案,从而能够在具有不同信息结构的任务之间进行有效转移。