开源项目
llama.cpp b11224:修复 Vulkan 读取缓存切片的错误
ggml-org / llama.cpp b11224
概述
llama.cpp 是本地模型推理项目,为开发者提供模型加载、计算后端和服务接口,适用于在不同硬件上运行语言及多模态模型。 b11224 修复 Vulkan 后端在矩阵算子读取较大 KV 缓存的切片时产生错误结果的问题,调整批步长与绑定范围,覆盖普通矩阵及专家计算路径。 变化关系到推理结果的正确性,使用 Vulkan 和缓存视图的部署可以重点复测相应输入与计算路径。