论文

MawForge:用于本地混合专家推理的内存限制专家具体化

MawForge: Memory-Bounded Expert Materialization for Local Mixture-of-Experts Inference

AI 基础设施推理服务

摘要

稀疏专家混合 (MoE) 语言模型将总参数计数与每个词元的主动计算分开,但本地推理系统通常仍然需要完整模型、键值缓存、运行时缓冲区和操作系统空间以适应快速内存。 MawForge 测试了一个不同的系统假设:通过将完整模型存储在磁盘上、保持通用张量驻留以及按需将路由专家张量具体化到有界执行缓存中,可以使本地 MoE 服务在受限统一内存机器上变得实用。主要发现是 MawForge 作为本地 MoE 推理的有界执行机制和测量基础是有效的,但作为缓存最大化策略却不是。性能取决于专家重用与驻留占用、KV 缓存大小、量化、路由局部性和 macOS 内存压力之间的平衡。