开源项目
llama.cpp WebGPU:MMVQ支持七种量化格式
b11406
概述
llama.cpp b11406为WebGPU后端的MMVQ(矩阵向量量化)路径加入Q1_0、Q5_0、Q5_1、Q3_K、Q5_K、Q6_K与MXFP4格式支持,并为Q1_0路径增加K_QUANTS_HANDLING宏。这扩大了在浏览器/WebGPU环境本地运行量化模型的格式范围,减少因格式不支持导致的回退。公告未提供性能对比;是否能完整运行取决于目标模型所有算子的后端覆盖,使用者应以目标模型在浏览器环境回归验证。