论文
SAEM:面向思维链推理内存高效 MoE 推理的阶段感知专家管理
SAEM: Stage-Aware Expert Management for Memory-Efficient MoE Inference in Chain-of-Thought Reasoning
摘要
思维链(CoT)提示通过把复杂问题分解为中间步骤来提升 LLM 推理能力,但其顺序性增加了解码延迟和内存占用。混合专家(MoE)模型通过稀疏专家激活扩展容量,但其完整的专家权重往往超出 GPU 显存,需要代价高昂的 GPU-CPU 传输。现有运行时对所有 token 一视同仁,忽略了 CoT 轨迹的一个关键结构特性:相邻推理阶段表现出连贯且可预测的专家激活模式。忽视这种阶段级规律会导致低效缓存和不必要的数据搬运。我们提出 SAEM,一种阶段感知的 MoE 推理运行时,它检测推理阶段边界并利用阶段级激活一致性来指导专家放置。SAEM 结合阶段感知缓存、专家对齐的 token 重打包和就地 CPU 执行,以减少数据传输和算子碎片。在数学和科学推理工作负载上,在受限 GPU 显存下,SAEM 相比最强的缓存与卸载基线平均取得 1.33 倍吞吐提升;当校准数据与工作负载匹配时提升至 1.54 倍,证明了阶段感知、局部性驱动的 MoE 推理对 CoT 推理的有效性。
