论文

超越全球路由聚合:MoE 视觉语言模型的阶段感知专家合并

Beyond Global Routing Aggregation: Phase-Aware Expert Merging for MoE Vision-Language Models

模型优化模型合并

摘要

专家混合视觉语言模型 (MoE-VLM) 通过稀疏专家激活来提高模型容量,但部署需要存储完整的专家池。 无需训练 专家合并减轻了这种负担,并且许多基于路由的方法聚合所有词元的路由统计数据以确定合并兼容性。然而,MoE-VLM 推理是阶段结构的:图像上下文标记携带视觉内容,问题标记指定查询,答案标记产生输出,具有不同的计数和路由分布。由于图像上下文标记的数量要多得多,因此全局聚合可能会过分强调图像上下文处理并模糊阶段条件专家角色,从而使服务于不同阶段的专家看起来可以互换并降低模型性能。因此,我们认为 MoE-VLM 专家合并应该保留阶段调节的专家角色,通过专家如何服务不同阶段而不是全局汇总的路由统计来判断兼容性。基于这一观点,我们提出了 RoleMerge,这是一种 无需训练 方法,该方法根据阶段归一化路由统计数据构建每个专家的路由角色配置文件 (RRP),捕获其相对阶段偏好。在专家阶段信息丢失的指导下,RoleMerge 将专家与兼容的配置文件及其相应的路由器条目合并,同时保留答案解码专家的区别。对三个模型和多个基准的实验表明,在匹配的专家保留率下,RoleMerge 比其他专家合并方法保留了更多的完整模型性能,六任务宏平均性能的相对改进高达 9.6%。这些结果验证了阶段调节专家角色是比 MoE-VLM 专家合并的全局路由聚合更有效的基础。