论文

MoA 结构解码注意力 DNF 推导、KV 缓存累积、GQA/MQA 和 OpenACC 内核

MoA-Structured Decode Attention DNF Derivation, KV-Cache Accumulation, GQA/MQA, and OpenACC Kernel

模型推理KV Cache

摘要

我们使用数组数学 (MoA) 导出了 Transformer 注意力的四个内存最佳推理工件,每个工件都直接来自前向传递指称范式 (DNF),其中查询行索引固定到当前解码步骤。这些工件是:(1)~单查询解码 DNF,其中 $ψ$ 减少以代数方式消除了 $K^\top$ 缓冲区,实现 $(d_k + nd_k+ nd_v+ d_v)\times4\,{B}$ 动态随机存取存储器 (DRAM) 流量结果数字验证为 $\|{err}\|_\leq2\times10^{-7}$; (2)~一个 C/OpenACC 图形处理单元 (GPU) 内核,具有操作范式 (ONF) 跨步算术和硬件合并内存访问,已验证为 $\|\mathrm{err}\|_\infty=0$ (精确的 IEEE-754 浮点算术); (3)~多步 KV 缓存,每步通过 MoA 串联 $O(d_k+d_v)$ 附加 $\#$; (4)~通过 $ψ$ 选择导出的分组查询注意力 (GQA) 和多查询注意力 (MQA),经证明可减少 KV 流量 $\frac {h_q} { h_{kv} }$。所有程序均根据 PyTorchscaled_dot_product_attention 进行验证。