论文

ACE:适应性无校准专家跳过方法用于基于MoE的大型语言模型

ACE: Adaptive Calibration-Free Expert Skipping for MoE-based LLMs

摘要

专家混合 (MoE) 架构为扩展大型语言模型 (LLM) 提供了有效的范例,但固定的 top-k 路由会为每个Token激活相同数量的专家槽,从而导致大量冗余计算。现有的专家跳过方法通常依赖于路由器置信度、校准数据或额外的训练,因此无法可靠地估计路由专家的实际贡献。为此,我们提出了 ACE,这是一种免训练、免校准和检查点保留的框架,用于基于 MoE 的 LLM 中的Token自适应专家跳过。 ACE 包含两个互补的组件: 1) 全局谱代理 (GSP),它根据耦合门、向上和向下投影以及 RMSNorm 缩放来估计全局变换能力; 2)路由器条件细化(RCR),它根据中心路由器权重构建专家特定的方向原型,并沿着路由首选方向评估专家响应。在推理过程中,ACE 将两种估计与运行时路由器门结合起来,仅当两个视图都将其识别为低贡献时才跳过专家槽,同时始终保留前 1 名专家。所有专家统计数据都是离线计算的,只留下表查找和轻量级标量操作在线。三个基于 MoE 的大语言模型和八个基准的广泛实验表明,ACE 始终优于现有的静态和动态基线,并且在积极的专家跳过下具有越来越明显的优势。例如,在 Qwen3.6-35B-A3B 上的跳过率为 50% 时,与最强的竞争方法相比,ACE 将 WikiText-2 困惑度降低了 7.96%,并将平均下游准确度提高了 4.15 个百分点。

ACE:适应性无校准专家跳过方法用于基于MoE的大型语言模型:论文配图
图 2:ACE 概述。全局谱代理 (GSP) 根据冻结的 SwiGLU 权重估计每个专家的转换能力,而路由器条件细化 (RCR) 则评估沿路由器诱导方向的响应。在推理过程中,ACE 将离线分数与Token明智的路由器门相结合,以跳过低贡献的专家槽并聚合幸存的专家。