论文

分解能走多远?高效 MoE LLM 服务的注意力 FFN 分解的设计空间探索

How Far Can Disaggregation Go? A Design-Space Exploration of Attention-FFN Disaggregation for Efficient MoE LLM Serving

模型推理分布式推理

摘要

现代 大语言模型 (LLM) 推理已逐步分解,以跟上不断增长的模型大小和严格的 TTFT 和 TPOT 服务级别目标:从分块预填充聚合到预填充解码 (P/D) 分解,以及最近到操作员级注意力 FFN 分解 (AFD)。这种趋势对于专家混合 (MoE) 模型尤其重要,其中内存限制注意力、计算密集型专家 FFN 和 MoE 调度/组合通信会产生不同的资源需求。 AFD 通过将注意力和 MoE-FFN 执行放在不同的 GPU 组上,进一步暴露了这种异构性。每个级别的分解都加深了跨工作负载特征、资源分配和互连拓扑的调度设计空间,从而提出了一个核心问题:每个级别何时真正获得回报?我们系统地描述了跨输入/输出序列长度、前缀 KV 重用和每用户延迟约束的实际工作负载的 MoE 推理的这种权衡。使用分块预填充和 P/D 分解作为基线,我们通过将设备上内核测量与高保真网络模拟相融合的框架大规模研究 AFD 的优点和局限性。在严格的 TTFT/TPOT SLO 下,AFD 在 DeepSeek-V3.2 上的聊天、编码和代理编码工作负载中维持约 4k token/s 的系统吞吐量,而非 AFD 部署在这些工作负载中是不可行的。我们提炼出联合优化吞吐量和交互性的具体要点,包括如何根据工作负载和模型架构在 GPU 之间划分注意力和 FFN,为当前的机架和集群规模部署以及未来分解的 AI 基础设施提供设计原则。