论文
量化专家混合实例固定池上的质量约束路由
Quality-Constrained Routing over a Fixed Pool of Quantized Mixture-of-Experts Instances
摘要
量化专家混合 (MoE) 服务可以保存一个基本模型的多个预物化实例,但量化损坏在不同请求和位宽之间变化很大。由于实例实现和副本计数会消耗内存并需要缓慢的重新配置,因此我们将它们视为上游配置决策并研究固定驻留池内的路由。在这个固定池边界内,我们路由每个请求,以在类级别预期质量下降预算和测量的实例容量下最大化建模吞吐量。为了预测这种特定于请求的风险,我们引入了 FWP(脆弱性加权困惑度),它是根据参考实例预填充上的提示标记计算出来的,并针对候选实例降级进行了校准。 FWP 的底层是精确的两位专家亲和力——脆弱性分解和条件多层 top-$k$ 扩展,其偏差、交互、路线更改、可分离性和高阶项仍然是明确的。使用这些校准的风险,窗口级线性程序会产生一个带符号的减少奖励分数,该分数与最优价格和原始可行平局分配下的 LP 最优值 KKT 一致。在 88 个扩展 Qwen 提示中,量化所有 6,144 个专家块的完整 W2、W3 和 W4 实例产生的平均 $Δ$NLL 为 $0.9437$、$0.1832$ 和 $0.0513$。在相同的人口和 $τ=0.1513$ 下,FWP 分配达到 $1.284\times$ 离线模型乘数,而请求无关的混合为 $1.253\times$,静态 W4 为 $1.000\times$,相对 FWP 增益增量为 $2.5\%$。