论文
RaMP:专家混合的运行时感知巨核多态性
RaMP: Runtime-Aware Megakernel Polymorphism for Mixture-of-Experts
摘要
混合专家 (MoE) 推理的最佳内核配置取决于批量大小和专家路由分布,但生产系统仅根据批量大小进行调度,从而导致 10-70% 的内核吞吐量未实现。我们提出 RaMP,一个路由感知调度框架。当每次优化都有帮助时,性能区域分析仅从硬件常量中得出,可以正确预测所有 8 个测试的架构,包括 3 个未见过的架构。四参数 Wave 成本模型从运行时专家直方图中选择最快的配置,与穷举搜索相比,平均后悔率达到 0.93%,每个模型只需 10-24 分钟的一次性分析即可拟合。由于该模型仅依赖于 CTA 网格几何形状,因此与内核无关:应用于 Alpha-MoE,它无需修改源即可提供 1.14 倍的性能。与公开 134-268 多态配置的共同设计的 CuTe DSL 内核配合使用,RaMP 比静态调度实现 1.22 倍的内核加速,通过 Triton 提供 1.30 倍的 vLLM 端到端加速,比 DeepGEMM 实现 1.41 倍,比 FlashInfer CUTLASS 实现 1.13 倍。