开源项目
llama.cpp Vulkan:量化KV稀疏FlashAttention
b11413
概述
llama.cpp b11413为Vulkan后端加入针对量化K/V的稀疏FlashAttention,并引入单次扫描的稀疏FA索引压缩:此前压缩每个掩码行需要一个工作组遍历,现改为单次扫描。这使长上下文下注意力可跳过被掩码的块,配合量化KV缓存降低显存占用。同日b11424修复Vulkan Flash Attention共享内存写出越界,b11414修复prealloc_y在FlashAttention与soft_max间的过期复用;两者为正确性修复,建议随b11413一并部署。公告未提供量化加速数据,收益需按模型与序列长度实测。