开源项目
llama.cpp b11372:Qwen4Exp索引器内存减半并统一lightning实现
b11372
概述
llama.cpp b11372围绕Qwen4Exp的lightning indexer做推理优化:原先索引器对全部头一次性算分并对副本整流,两个[n_pool, n_idx_h, n_tokens]的f32张量同时存活;改为把按1/sqrt(head_dim)缩放的整流头得分无权和视作全同权lightning indexer,直接在池化键上调用ggml_lightning_indexer,键只为所有头读取一次,不再物化逐头得分,索引得分内存约减半。配套包括CUDA对4头走向量内核、Metal把头数做成函数常量并零填充尾块、Vulkan按键与词元分块并以共享内存与fp16点积向量化加载。同日b11352对Qwen4Exp的掩码构建优化并同步到GLM5-next,已合并入本条。公告未给跨后端统一提速数字;使用者需采用对应构建并按模型与后端实测。