优化MoE缓存命中率的质量代价:路由训练的负向结果与系统测量
Cacheable by Design? Training Mixture-of-Experts Routers for Locality Against the Edge Memory-Bandwidth Wall: A Pre-Registered Negative Result with a Systems Measurement Study
摘要
在单块8 GB GPU上服务一个2350亿参数的混合专家(MoE)模型,瓶颈不是计算而是内存带宽:解码时必须从持有该token活跃专家的层级将其流出,而在消费级硬件上大多数专家位于远慢于内存的SSD上。我们在Qwen3-235B(Q4_K_M,134 GB)上量化了这一带宽墙:实测解码在热缓存下为0.44 tok/s,与每token字节数/带宽模型吻合,而一个本应摊销单次磁盘扫描的批处理方案在batch 32时因分页抖动而崩溃。我们构建了llama-moe-trace这一零改造的路由遥测工具,并测量了Qwen3-30B上的路由:相邻token的专家复用率为随机的2.0倍,95%的流量使用52.5%的专家,一个占13.4%专家的LRU缓存可服务66%的请求。我们随后追问可缓存性是否可训练:我们预注册了一项训练137M MoE语言模型的实验,采用辅助局部性与域路由损失,并设定缓存未命中降低与困惑度的联合判据。机制有效(未命中最多降低60%;99%的静态固定命中率),但每个配置都未能通过预注册的≤1%困惑度门槛——未命中降低与质量紧密耦合。同时期的StickyMoE在单域、小于25M参数的模型上报告该损失近乎免费;我们发现,在多域137M模型上代价是真实的。一个340M规模的档位显示该代价不随规模缩小(反而略有上升)。我们进一步表明,免训练的缓存感知重路由可以与训练出的局部性叠加——在两个规模上合计约80%的未命中降低,困惑度≤3.4%,远比任一单独手段便宜——而面向域的预取并无帮助。所有代码、轨迹与预注册均已发布。