论文
更少的专家,更快的解码:具有成本意识的 推测解码,适合专家混合
Less Experts, Faster Decoding: Cost-Aware Speculative Decoding for Mixture-of-Experts
摘要
稀疏专家混合 (MoE) 模型已成为扩展 大语言模型 (LLM) 的重要方法,但其推理效率在很大程度上取决于专家激活模式。 推测解码 (SD) 通过并行验证多个草稿词元来加速自回归生成,但现有的草稿选择策略主要优化接受可能性。然而,在大规模 MoE 模型中,选择草案词元也决定了验证期间激活的专家联盟。我们观察到,置信驱动的 SD 可以引入 \textit{专家散射}:高概率的草稿词元可能会路由到不相交的专家,从而增加专家权重内存流量并降低推测的加速。受这一观察的启发,我们重新审视 MoE 推理的非均匀内存成本结构下的草稿树选择。我们提出 \textsc{EcoSpec},一个成本感知的 推测解码 框架,它将预测的边际专家激活成本纳入选秀选择中。借助轻量级专家预测器和动态专家缓冲区,\textsc{EcoSpec} 支持保留高接受可能性的草稿路径,同时重用当前验证集已涵盖的专家,而无需修改目标模型验证规则。我们在三个大型 MoE 模型上评估 \textsc{EcoSpec},包括 DeepSeek-V3.1 (671B)、Qwen3-235B-A22B 和 GPT-OSS-120B,涵盖推理、编码、问答和对话基准。 \textsc{EcoSpec} 持续减少活跃的专家足迹并提高端到端解码速度,实现高达 1.62\times$ 的加速。这些结果表明,考虑专家激活成本对于大规模 MoE 模型中的高效 推测解码 非常重要。