论文

AcceptMoE:用于高效 MoE 的承诺加权自调整验证器专家集 推测解码

AcceptMoE: Commitment-Weighted Self-Sizing Verifier Expert Sets for Efficient MoE Speculative Decoding

模型推理投机采样

摘要

推测解码 在一个目标模型前向传递中验证草稿词元树。然而,对于专家混合 (MoE) 目标,并行验证可以激活所有树节点选择的专家的联合,即使这些节点中只有一小部分达到了可接受的输出。因此,词元计数、激活的专家联合大小和专家权重流量是不同的成本衡量标准:减少词元工作负载不需要按比例缩小专家联合,并且在卸载情况下,传输流量也取决于缓存驻留。我们引入了 AcceptMoE,一种验证者端专家选择器,它将目标路由器分数与离线估计的承诺概率相结合,并自动调整每个验证块的合格专家数量,从而消除了用户指定专家预算的需要。在卸载下,AcceptMoE 根据缓存驻留条件确定专家资格,而不是预测自然路线并预取相应的专家权重。尽管限制目标专家资格会改变模型分布,但在涵盖三个 MoE 目标和四个基准的 12 个模型任务对中,AcceptMoE 的平均准确度比采用自然路由的 EAGLE-3 推测解码 低 0.27 个百分点。在批量大小为 1 的 SGLang 中使用时,在 GPU 内存中所有专家权重的情况下,它的吞吐量达到了该基准的 1.290 倍,在物理专家卸载下达到了 2.06 倍,同时将主机到设备的流量减少了 73.6% 至 77.1%。