论文
TIDE:高效且无损的 MoE 扩散 LLM 推理,具有 I/O 感知专家卸载
TIDE: Efficient and Lossless MoE Diffusion LLM Inference with I/O-aware Expert Offload
摘要
Diffusion 大语言模型 (dLLM) 已成为自回归 (AR) 模型的竞争替代品,通过并行块级解码提供更好的硬件利用率和双向上下文。然而,随着 dLLM 继续通过混合专家 (MoE) 架构进行扩展,它们在资源受限的设备上的部署仍然是一个开放的挑战。现有的基于 AR 的方法通常会产生过高的 I/O 开销或严重的计算瓶颈。在这项工作中,我们提出了 TIDE,这是一种新颖的资源高效推理系统,它在块内的扩散过程中利用专家激活的时间稳定性。具体来说,我们在块内的扩散过程中利用专家激活的时间稳定性,并引入基于间隔的专家刷新策略,以 I/O 感知的方式更新专家放置。为了确保最佳性能,我们将推理调度制定为数学规划问题,求解最小化 I/O 流量和 CPU 计算的最佳间隔。最重要的是,TIDE 是一种无损优化,不需要 模型训练,为 dLLM 推理提供“免费午餐”加速。在单个 GPU-CPU 系统中,我们证明 TIDE 在 LLaDA2.0-mini 和 LLaDA2.0-flash 模型上的吞吐量分别比之前的基准提高了 1.4$\times$ 和 1.5$\times$。