开源项目

llama.cpp b11182:模型驱动的 W4A4 执行路径

ggml-org/llama.cpp b11182

AI 基础设施模型部署

概述

llama.cpp 是以 C/C++ 为核心的开源大模型推理项目,支持在本地 CPU 和多种加速器上运行模型。 llama.cpp b11182 增加 llama_prec_policy 和由模型驱动的 W4A4 执行路径。W4A4 指权重与激活都采用4位表示,相关路径根据模型精度策略组织计算。 发布过程还调整了激活策略映射、CUDA 量化矩阵乘与 MXFP4 分发,并修复构建和代码审查中发现的问题。发布说明未给出覆盖所有模型的速度与精度对照,需要按具体模型验证。