论文

使用 Apple Silicon NPU 进行高效的专家混合 LLM 推理

Efficient Mixture-of-Experts LLM Inference with Apple Silicon NPUs

AI 基础设施推理服务

摘要

Apple 神经引擎 (ANE) 是每个 Apple Silicon 芯片中都存在的专用神经处理单元 (NPU)。专家混合 (MoE) LLM 通过稀疏激活提高推理效率,但在三个方面对 NPU 构成挑战:专家路由不可预测,并引入与 NPU 的形状特定约束相冲突的动态张量形状;一些不规则的算子,例如top-k、scatter/gather等,对NPU不友好;并且启动许多小型专家内核会产生大量的调度和同步开销。 NPU 旨在减轻 CPU 和 GPU 的人工智能计算负担;我们的目标是为 MoE 推理实现此类卸载,特别是在预填充期间,长上下文工作负载会消耗大量系统资源。本文介绍了 NPUMoE,这是一种运行时推理引擎,它通过将密集的静态计算卸载到 NPU 来加速 Apple Silicon 上的 MoE 执行,同时保留动态操作的 CPU/GPU 后备路径。 NPUMoE 使用离线校准来估计专家容量和受欢迎度,从而驱动三种关键技术:(1) 专家容量静态层,以解决动态专家路由问题 (2) 分组专家执行,以减轻 NPU 并发限制 (3) 负载感知专家计算图驻留,以减少 CPU-NPU 同步开销。使用三个代表性 MoE LLM 和四个长上下文工作负载在 Apple M 系列设备上进行的实验表明,NPUMoE 的性能始终优于基准,通过有效的 NPU 卸载,将延迟减少了 1.32x-5.55x,将能源效率提高了 1.81x-7.37x,并将 CPU 周期使用率减少了 1.78x-5.54x。