论文

让每一个已验证的词元都发挥作用:MoE 推测解码 的自适应验证

Making Every Verified Token Count: Adaptive Verification for MoE Speculative Decoding

模型推理投机采样

摘要

基于树的 推测解码 通过并行验证多个候选草案来加速自回归生成,但对于稀疏专家混合 (MoE) 模型,这种优势会减弱。随着草稿树的生长,不同的分支激活不同的专家,扩大了激活专家的并集,大大增加了目标端的验证成本。我们提出了 EVICT,一种用于 MoE 推测解码 的 无需训练、无超参数、无损自适应验证方法。 EVICT 通过在目标验证之前截断草稿树并仅保留具有成本效益的前缀来对每个已验证的词元进行计数。它利用细粒度的起草者信号来估计候选人的利益,将其与离线分析的验证成本相结合,并与基于高性能图的服务框架 SGLang 保持高度兼容。对不同 MoE 主干和基准的大量实验表明,EVICT 比自回归解码实现了高达 2.35 倍的加速,比最先进的基线 EAGLE-3 平均加速了 1.21 倍,同时显着减少了验证过程中不必要的专家激活。