开源项目

llama.cpp b11362:Metal加入F16 KV张量APIFlashAttention内核

b11362

AI 基础设施推理服务

概述

llama.cpp b11362为Metal后端补充基于张量API的flash attention内核,覆盖F16 KV缓存,新增DK=DV=512、DK=576配DV=512及DK=192配DV=128等头部维度组合,并在内核中支持attention sinks、ALiBi与logit softcap。这些内核扩充了Apple Silicon上F16 KV注意力的可用维度范围,减少回退到非融合路径的情况。公告未提供逐设备性能对比;启用情况取决于模型头维度、系统与构建,需在目标设备实测。