论文
TileMix:面向LLM推理加速的以Tile为中心的混合精度注意力
TileMix: Tile-Centric Mixed-Precision Attention for LLM Inference Acceleration
摘要
大语言模型(LLM)的长上下文预填充(prefill)因稠密自注意力要计算平方级的查询-键分数而带来可观的计算与内存流量。现有方法要么采用统一的低精度路径,要么挑选token交互,把硬件对齐分数tile上的空间精度路由留在了融合稠密注意力之外。我们提出TileMix,一个以tile为中心的精度路由内核,使数值精度成为融合稠密注意力内部、作用在分数tile组上的可执行空间决策。TileMix把注意力矩阵划分为硬件对齐的分数tile,将路由决策打包成紧凑的位掩码,并通过FP16或INT8分数计算调度每个tile组,同时两条路径更新共享的在线softmax状态。可扩展的精度分组让每个路由位管理多个相邻键tile,在长上下文下保持硬件对齐的计算tile与紧凑的元数据。通过路由所有合法的tile组,TileMix保留了稠密token连接,无需训练,并支持分组查询注意力、变长批次和INT8键/值缓存。在LLaMA、Qwen和Vicuna上的LongEval、LV-Eval与A100预填充基准中,TileMix恢复了统一INT8下损失的长上下文质量,并提升了相对FP16的预填充吞吐量,在模型族之间形成可控的精度-效率前沿。实现发布于 https://github.com/HanzhiZhang-Ulrica/TileMix。
