开源项目
llama.cpp b11265:按MoE专家实际行数选择Vulkan矩阵分块
b11265
概述
llama.cpp在b11265修正Vulkan后端mat_mul_id的分块选择。此前按总词元数选择矩阵tile,但MoE dispatch中每个workgroup实际处理的是对应专家的行数;日志给出Sarvam 30B在pp128时实际仅6行的例子,过大的分块导致多数线程空闲,相关慢路径占该测试任务耗时55%。新逻辑依据专家行数选择分块,面向稀疏专家负载改善执行效率。同日b11266调整对齐F32矩阵的双元素加载,给出Intel B60部分形状的算子对照,也明确并非所有形状都改善;b11267调优GDN shader和Intel路径。这三项作为同日Vulkan优化系列归并,使用时需升级相应构建并按模型、专家负载和设备复验,不能把单算子变化写成通用整模型加速。