论文
BaseRT:通过 Native Metal 对 Apple Silicon 进行一流的 LLM 推理
BaseRT: Best-in-Class LLM Inference on Apple Silicon via Native Metal
摘要
我们推出了 BaseRT,这是 Apple Silicon 上 大语言模型 (LLM) 的原生 Metal 推理运行时,并报告了迄今为止该硬件上的最高推理吞吐量。现有的运行时(包括 llama.cpp 和基于 MLX 的框架)会因并非为 Metal 的执行模型或 Apple Silicon 的统一内存拓扑设计的抽象而产生开销。通过在 Metal 上进行原生构建,并使用特定于芯片的内核融合、统一的内存感知优化和自定义调度逻辑,BaseRT 恢复了基于框架的方法留下的性能。 BaseRT 在所有 Apple M 系列设备上支持跨八种量化格式(Q2 至 FP16)的广泛模型系列。在本文中,我们在 M3 和 M4 Pro 设备上评估 Qwen3、Llama 3.2 和 Gemma 4 系列的 Q4 和 Q8 量化。 BaseRT 的解码吞吐量比 llama.cpp 高出 1.56 倍,比 MLX 高出 1.35 倍,并且在混合专家模型的预填充上具有更大的余量,从 1B 到 30B 参数模型都能提供一致的一流吞吐量。这些结果使 Apple Silicon 成为比之前报道的更强大的推理平台,对新兴的边缘推理范式具有直接影响:随着隐私要求、延迟限制和云成本压力推动推理向设备上部署,性能优化的本地运行时是这一转变的关键支持层。 BaseRT 可在 https://github.com/basecompute/baseRT 上公开获取