论文
LampAttention:面向专用加速器的混合精度FlashAttention
LampAttention: Look-Ahead Mixed-Precision FlashAttention for Dedicated Accelerators
摘要
多数注意力logits可以用低精度计算而不破坏数值稳定性,但现有注意力内核未充分利用这一点。本文提出硬件与算法协同设计的混合精度FlashAttention:以8位格式累加键—查询乘积并计算指数,再自适应识别敏感子块,以16位格式重新计算。作者同时提出可高效执行这一流程的专用加速器规格。Qwen3与Gemma3的仿真实验显示,只需把少数子块转向高精度计算,就足以恢复基线模型的表现。