开源项目
llama.cpp CUDA同日优化:整tile FA调度、MMVF细矩阵与NVFP4累加
b11402
概述
llama.cpp当日CUDA后端三项变化(已合并记录,保留各自Release证据):b11402优先为高效两段内核选择整tile FlashAttention调度;b11403在小批量下为细长f16/bf16矩阵乘启用MMVF路径并调整内核选择逻辑;b11417优化mmq_vec_dot_fp4_fp4_mma的累加并修正mma_block_scaled_fp4循环缩进。三者分别作用于注意力调度、小批量矩阵乘与NVFP4量化路径,发布说明未提供统一性能对比;使用者需采用对应构建并以llama-bench在目标模型、批量与GPU上实测。同日b11425使alloc_deps检查与批量无关、b11399重构swizzling代码、b11397移动neu_padded,属代码整理,不改变行为。