论文

用于内存高效 MoE 推理的缓存感知联合路由器自适应

Cache-Aware Joint Router Adaptation for Memory-Efficient MoE Inference

摘要

专家混合 (MoE) 模型每个词元激活很少的专家,但其完整的专家集可能会超出 GPU 内存,并且需要在解码过程中重复权重传输。我们将专家缓存管理制定为模型端算法问题,并提出缓存感知的 后训练,它联合适应 MoE 主干和轻量级辅助路由器,同时保留本机推理时间 Top-K 规则。仅更新的临时路由器无需主动加载即可学习跨词元的同层保留。完整的时空路由器添加了一个空间路由器,该路由器使用因果前身的隐藏状态来在目标层访问之前细化时间缓存。我们在 Qwen3 和 GPT-OSS 上跨 GSM8K、MATH 和 CommonsenseQA 评估这两种模式。与匹配的仅 LM 基线相比,时态路由器持续提高命中率并减少专家权重流量。在Qwen3上,相对于最强评估的预取基线,完整模式将调整后的命中率提高了1.15--18.03点,并减少了4.6--53.3%的流量; GPT-OSS 结果具有竞争力,但取决于任务。仅辅助训练可保持基线准确性,但会产生适度的覆盖范围增益;联合 后训练 实现了更高的覆盖范围。敏感性分析区分缓存容量、优化预算和缓存丢失权重对覆盖范围、流量和质量的影响。