开源项目
llama.cpp 同日更新 GLM-5 MTP、Metal 正确性与 SYCL MLA
b11476
概述
llama.cpp 是用于本地模型推理的开源运行时。本日多个 build 按项目合并,最终引用 b11476。GLM-5 的 MTP 支持拆分主干与推测模块 GGUF,并在最终方案中将所述追赶步骤从约 6.9 ms 降至 2.9 ms,早期临时方案不作为最终效果。Metal 修正矩阵乘加残差在特定决策模型路径上的错误输出,并改进少行矩阵乘。SYCL 在 GLM-4.7-Flash 特定 MLA/GQA 形状及 Arc Pro B70 的 pp8192 测试中,由 432.8 提升到 1292.29 token/s,不能外推为解码加速。K2 Horizon 转换与聊天模板改进、共享内存 RPC 张量传输协议变化也在本日版本内;最终 K2 张量并行仍禁用。已回退的 F16 分数优化不计入成果。