开源项目

llama.cpp b11331:修正CUDA NVFP4计算精度配置

b11331

概述

llama.cpp的CUDA推理后端在b11331调整NVFP4相关的cuBLAS计算类型:在硬件允许时,对量化模型采用BF16计算,并为需要至少BF16数值范围的NVFP4设置对应累加精度;更新还保留逐专家矩阵乘法的op_params。用户需选择兼容硬件和包含改动的构建,并回归自己的模型输出。发布说明未提供通用提速比例或精度恢复数值。