开源项目

llama.cpp b11195:CPU 量化矩阵乘微内核分块执行

ggml-org/llama.cpp b11195

AI 基础设施模型部署

概述

llama.cpp 是以 C/C++ 为核心的开源大模型推理项目,支持在本地 CPU 和多种加速器上运行模型。 llama.cpp b11195 为 CPU 的 k-quants 量化矩阵乘引入分块执行:先将量化数据解包为最多256×256的 int8 块,再由微内核计算16×16小块并写回浮点结果。 发布说明称,大型矩阵乘测试提速3—6倍;在4096×64与64×4096矩阵相乘附近达到收支平衡,而 GEMV 速度约降至原来的80%。因此收益取决于计算形状,不能把大型矩阵测试的提升外推到全部推理负载。