开源项目
llama.cpp b11178:摩尔线程 MTT S5000 MUSA 支持扩展
ggml-org/llama.cpp b11178
概述
llama.cpp 是以 C/C++ 为核心的开源大模型推理项目,支持在本地 CPU 和多种加速器上运行模型。 llama.cpp b11178 修复摩尔线程 MTT S5000 的 MUSA 算子与构建问题。更新将相关复制宽度从8字节调整为16字节,并修复 FlashAttention 和量化矩阵乘路径的适配。 在发布说明列出的 MTT S5000、MUSA SDK 5.2.0 和 Qwen3.8-27B-UD-Q4_K_M 测试中,开启 FlashAttention 后预填充由751.15升至794.73 Token/s,解码由15.59升至15.69 Token/s;关闭 FlashAttention 时性能基本不变。这是特定设备与配置的结果。