开源项目
llama.cpp b11430 为 Hexagon 注意力增加按核心 KV 头划分
ggml-org/llama.cpp b11430
概述
llama.cpp b11430 在 Hexagon 注意力执行中加入按核心划分 KV 头的路径,默认启用相应标志。只有 KV 头数可被核心数整除时采用该方式,否则保留按 token 划分的回退路径。发布说明在四核心、ubatch=1024 的测试条件下报告:Qwen3 0.6B 预填充从约 6,977 提高到 11,026 token/s,约提升 58%;Llama3.2 3B 从约 3,717 提高到 5,522 token/s,约提升 49%;Qwen3.5 4B 约提升 4%。单 token 生成性能没有相应提升。这是设备后端并行实现的更新,采用项目 MIT 许可;数字为维护者披露,未在本机执行硬件复现。部署者应核对设备、KV 头数和批大小是否满足路径条件。