开源项目
NeelM0906/Mference:Apple 芯片上权重超内存的大模型流式推理运行时
NeelM0906/Mference
概述
Mference 是面向 Apple Silicon 的 Swift+Metal 原生推理运行时(Swift 6.1+/Metal 3+/macOS 15+,MIT),让权重超过内存的前沿模型也能本地运行。它利用 MoE 每 token 只激活部分参数的稀疏性,把工作集控制在有界范围:共享核心与 KV 缓存常驻内存,选中的专家从 SSD 按需流式读取。实测:180B MoE 的 Qwen3.8-Flash-Next 在 M3 Ultra 上解码 18.2–21.0 tok/s。