开源项目

llama.cpp Metal:推测解码少行MMA矩阵乘

b11404

模型推理推理加速

概述

llama.cpp b11404为Metal后端加入少行MMA矩阵乘与面向推测解码的批量拷贝。推测解码每步只验证少量草稿词元,此前Metal在无张量API时以矩阵-向量内核运行这些乘法,GPU利用率低;少行MMA路径以矩阵-矩阵形态处理少量行,配合批量拷贝减少调度开销。公告未提供量化提速;使用推测解码的Apple Silicon用户应以目标模型与草稿设置实测接受率与延迟变化。