开源项目
llama.cpp b11374:OpenVINO后端升级2026.4.1并融合MoE
b11374
概述
llama.cpp的ggml-openvino后端随b11374升级到OpenVINO 2026.4.1及GPU驱动26.35.39758.10。主要变化:为门控与升投影合并为单一权重的模型(gemma-4形态)加入FuseMoeCompressedFusedGateUp图融合,并把专家输出缩放精确折叠进路由权重;为Qwen3.5加入推理剖析、默认远程输出张量与单序列递归状态优化;修复状态执行下的rank-3轴处理,使MoE可在GGML_OPENVINO_STATEFUL_EXECUTION=1下运行;设备枚举重写,未选中的GGML_OPENVINO_DEVICE直接报错而非静默回退,远程上下文创建失败即中止;HARDSIGMOID与EXPM1改为f32计算(NPU除外)。性能条件须完整保留:gemma-4-26B-A4B在Arc B390、GGML_OPENVINO_REQUANT_KQUANT=q4_asym64_all、llama-bench -p 512 -n 128 -r 2条件下,pp512从66.16升至1608.73 tokens/s,tg128仅从25.94至26.46;不开该重量化选项、使用独立门控升投影权重或在CPU上均无此收益。质量边界:12块困惑度在大幅方差内相当(1451.3±177.9对1427.6±175.1);公告明确该模型在OV上无状态与状态执行都会退入退化重复,后端测试仍存在两个既有MUL_MAT_ID失败;状态执行tg128可达29.91但已知融合不匹配rank-3会失去预填充融合。采用者需使用对应构建并在目标硬件复测。