论文

Cascadia:在 11 台 AI PC 上驻留推理 975B MoE

Cascadia: Resident 975B MoE Inference on Eleven AI PCs

模型推理模型架构MoE分布式推理

摘要

混合专家模型借助稀疏逐词元计算获得近万亿参数容量,前提是服务系统能够分布权重并协调执行。Cascadia在11台Intel Core Ultra X7 358H AI PC上驻留运行Inkling,模型总参数975B、激活参数41B;每机64GB内存、Arc B390核显和千兆以太网。定制驻留MoE引擎保留Inkling路由规则,为OpenVINO融合核显原语构建压缩图,协调FP16专家计算和FP32输出恢复。每机存放六个连续解码层,将稠密前馈块表示为全激活专家切片,使所测稠密层调用时间约从8.1降至4.5毫秒。流式管线协调并发生成,捕获状态的草稿评测检查与实际数值路径的一致性。在1—176流的15档并发配对测量中,88流达到聚合解码60.29词元/秒,全服务阶段46.87词元/秒;15流的首词元延迟中位数为6.05秒。将默认1024位置预算提高后,1k—64k词元真实提示的19个所测回答都找回嵌入代码;首词元时间按 $aN+bN^2$ 增长,解码延迟近线性增长。瓶颈来自单线程CPU注意力而非可容纳每流512k位置的内存。捕获集群状态的评估还分离词表选择和权重量化对草稿一致性的作用,形成共享CPU/GPU内存客户端集群的大稀疏模型执行与评测方法。