WiSP:在资源极少的硬件上提供服务的专家混合工作集视图
WiSP: A Working-Set View of Mixture-of-Experts Serving on Extremely Low-Resource Hardware
摘要
现代本地和代理工作负载通常需要低并发下的大模型容量,但在无法保持前沿规模模型驻留的 GPU 上运行。专家混合(MoE)模型是一个自然的选择,因为它们只激活每个词元的一小部分专家,但它们的稀疏性节省了计算,而不是驻留:仍然需要存储完整的专家池,并且当该层运行时,该层使用的任何专家都必须位于 GPU 内存中。静态层级 CPU 卸载使此类模型适合,但会在每次前向传递时批量传输专家层,从而失去大部分稀疏性优势。我们将低资源 MoE 视为 GPU 上的工作集问题。路由专家权重和 KV 缓存是两个竞争相同有限 VRAM 的内存需求流。我们在 WiSP(工作集寻呼)中实现此视图,WiSP 是一种路由感知专家寻呼机,可插入未修改的服务引擎并保留字节相同的输出。在真正的 24 GiB RTX 3090 上,当模型不适合时,WiSP 在相同的内存预算下可实现高达 2.0 倍的静态卸载解码吞吐量。自然的下一步是预测未来的专家并预取它们。我们发现这对单流解码没有帮助:瓶颈是 PCIe 带宽,而不是预测质量,因此推测传输与需求传输竞争而不是隐藏它们。这将设计问题从预取转移到分配:一个 VRAM 预算应该如何在常驻专家和 KV 缓存之间分配?我们用 MV-WSA(边际值工作集分配)来回答,它通过每字节的边际延迟收益来分割内存,同时强制执行 KV 准入下限。作为启动配置器,MV-WSA 是我们测试的唯一在预填充和解码方面保持接近最佳状态的策略;作为实时控制器,它可以在服务时调整两个池的大小,并将端到端时间比固定离线分割减少多达 1.19 倍,而无需更改模型输出。