开源项目

llama.cpp以算术解码和专家权重重排加速SYCL上的MXFP4 MoE

llama.cpp b11540

模型推理模型优化推理加速量化

概述

llama.cpp是可在本地CPU及多种GPU后端运行大模型的推理工程。本次b11540更新SYCL后端的MXFP4 MoE路径,以32位算术代替查表解码,避免昂贵的permute模拟;再按专家延迟重排权重,支持对齐向量加载,并保留不对齐张量的通用回退。临时重排内存上限为32MiB。 维护者在Windows 11、oneAPI 2026.0和Intel Arc Pro B70上测试:gpt-oss-20b单卡解码由55.84升至106.64 tok/s,五次重复;gpt-oss-120b双卡由33.27升至67.14 tok/s,两次重复。120b提示处理从594.5升至600.1 tok/s,不能把解码提升写成全部推理均翻倍。两块设备的相关后端测试通过,20b困惑度变化处于噪声范围。其他GPU和Linux未测试,部署时应按目标负载复验。