开源项目

llama.cpp b11436 修复 OpenVINO 多模型执行与 NPU 动态形状

ggml-org/llama.cpp b11436

AI 基础设施模型部署

概述

llama.cpp 是加载并运行本地大模型的 C/C++ 框架,代码采用 MIT 许可,可从源码构建或使用发布的二进制。本次 b11436 集中修正 OpenVINO 后端:跳过未选择的计算路径,保持连续复制操作的后端归属;使 inp_scale_rows 的 token 维度能够随输入变化,处理 NPU 分块填充;修复 FILL 输出数据类型,避免 f16 路径越界;拒绝不支持的量化 CONCAT,并修正 GET_ROWS 状态缓存,使 Qwen3.5、Gemma3 等模型恢复有效输出。发布说明还排除不适合该后端的 Q4_1/Q4_K 测试格式,这不能解释为所有现实量化权重都存在问题。此次信号是设备后端可用性和执行正确性,没有新的普遍吞吐提升结论。