开源项目llama.cpp b11333:WebGPU增加BF16矩阵与行读取支持b11333ggml-org·来源日期:2026.10.01AI 基础设施推理服务收藏概述llama.cpp支持在不同计算后端运行本地模型。b11333在WebGPU后端加入bfloat16类型的矩阵乘法、带专家索引的矩阵乘法和行读取支持,对应MUL_MAT、MUL_MAT_ID、GET_ROWS三个算子。用户需使用包含该改动的WebGPU构建及兼容运行环境。公告披露的是算子支持扩展,没有给出整模型速度、内存或质量对比,不能据此推断所有BF16模型均可完整运行。