开源项目
llama.cpp b11370:CUDA把共享专家融合进MMVQ
b11370
概述
llama.cpp b11370修改CUDA后端,把MoE模型中所有词元都会经过的共享专家计算融合进MMVQ(矩阵向量量化)路径,配套增加空缓冲检查并把stride_col_dst移入融合参数结构。该改动减少共享专家独立内核的调度与访存往返。发布说明未提供具体模型的提速或吞吐对比,也未限定适用的共享专家维度。使用带共享专家的MoE模型且以CUDA解码的部署可采用包含该改动的构建,并用llama-bench在目标模型与批设置下实测收益。