开源项目
llama.cpp b11160:AMD RDNA3/4 Vulkan int8 量化矩阵乘
ggml-org/llama.cpp b11160
概述
llama.cpp 是以 C/C++ 为核心的开源大模型推理项目,支持在本地 CPU 和多种加速器上运行模型。 llama.cpp b11160 为 AMD RDNA3、RDNA4 增加 Vulkan int8 cooperative-matrix 量化矩阵乘实现。更新围绕量化数据读取、内联缩放和硬件能力检测调整 shader。 这是现有 Vulkan 后端对特定 GPU 与计算路径的扩展。实际效果取决于设备、驱动、模型量化格式和输入形状,发布说明不能提供所有 AMD 设备的统一提速结论。