论文
SpecPrefetch:面向稀疏MoE基础模型的参数高效专家预取
SpecPrefetch: Parameter-Efficient Expert Prefetching for Sparse MoE Foundation Models
摘要
稀疏混合专家(MoE)模型通过条件化的专家激活扩展基础模型容量,但在加速器内存有限时,其完整专家池仍然难以部署。尽管专家卸载通过将非活跃专家移至主机内存或存储来缓解内存压力,但它引入了依赖路由的传输瓶颈:所需专家只有在原生top-K路由之后才能确定,这使得推理过程中的路由、专家加载和专家执行被串行化。为解决这一瓶颈,我们提出SpecPrefetch,一个面向卸载式MoE推理的参数高效预取框架。SpecPrefetch使用一个共享的轻量适配器来预测下一层的专家候选,仅用于异步传输,而冻结的原生路由器仍然决定最终执行的专家。通过将传输预测与执行路由分离,SpecPrefetch在不改变预训练路由语义的情况下降低了暴露的专家加载延迟,因此预测错误只影响传输效率而非模型输出。此外,窗口感知调度器在缓存与带宽约束下对可行的传输进行优先级排序。在Qwen3-VL-30B-A3B和DeepSeek-VL2-Tiny上,SpecPrefetch在10个模型-基准设置中的9个取得最佳平均专家召回率,且可训练参数远少于学习式预测器基线。在Snapdragon 8 Elite设备上,SpecPrefetch较计算优化的卸载运行时进一步提升解码吞吐最高达20%,展示了在存储受限的MoE部署中的实用价值。代码和模型权重发布于https://github.com/wei390/SpecPrefetch。
